Gateway API pro AI Inference: Směrování provozu LLM na Kubernetes
Jak se LLM přesouvá na Kubernetes, týmy potřebují více než jen základní pravidla Ingress. Gateway API poskytuje expresivní směrování, výběr modelu na základě záhlaví a integrační body pro prosazování zásad – ideální pro platformy s více modely a postupné zavádění modelů.
Mezi běžné vzory patří vážené rozdělení provozu pro A/B testování nových modelů, limity rychlosti na úrovni požadavků pro ochranu fondů GPU a mTLS mezi bránou a inferenčními moduly. V kombinaci s Horizontal Pod Autoscaling a KEDA mohou organizace škálovat inferenční služby na základě hloubky fronty nebo propustnosti tokenů.
cloudstrata implementuje inferenční vrstvy založené na Gateway API na OpenShift a vanilla Kubernetes a propojuje je se systémy pozorovatelnosti, sledování nákladů a podnikových identit, takže provoz AI je bezpečný, měřitelný a připravený na produkci.
KONTAKT
Ozvěte se
Řekněte nám o svém případu použití – my vám odpovíme přizpůsobeným dalším krokem.
Naším cílem je odpovědět do jednoho pracovního dne.
Sledujte Cloudstrata na LinkedInu a Instagramu a zůstaňte v obraze ohledně naší práce a otevřených pozic.
Otevře se na nové kartě