Gateway API pre AI Inference: Smerovanie LLM prevádzky na Kubernetes
Keď sa odvodenie LLM presúva na Kubernetes, tímy potrebujú viac ako len základné pravidlá Ingress. Gateway API poskytuje expresívne smerovanie, výber modelov na základe hlavičiek a integračné body na presadzovanie pravidiel – ideálne pre platformy s viacerými modelmi a postupné zavádzanie modelov.
Bežné vzory zahŕňajú vážené rozdelenie návštevnosti pre A/B testovanie nových modelov, limity rýchlosti na úrovni požiadaviek na ochranu GPU poolov a mTLS medzi bránou a inferenčnými modulmi. V kombinácii s Horizontal Pod Autoscaling a KEDA môžu organizácie škálovať inferenčné služby na základe hĺbky frontu alebo priepustnosti tokenov.
cloudstrata implementuje inferenčné vrstvy založené na rozhraní Gateway API na OpenShift a vanilla Kubernetes a spája ich so systémami pozorovateľnosti, sledovania nákladov a podnikovej identity, takže prevádzka AI je bezpečná, merateľná a pripravená na produkciu.
Preskúmajte viac
KONTAKT
Ozvite sa
Povedzte nám o svojom prípade použitia – odpovieme vám prispôsobeným ďalším krokom.
Naším cieľom je odpovedať do jedného pracovného dňa.
Sledujte Cloudstrata na LinkedIn a Instagrame a zostaňte informovaní o našej práci a otvorených pozíciách.
Otvorí sa na novej karte