Gateway API for AI Inference: LLM forgalom irányítása Kubernetesen
Ahogy az LLM-következtetés átkerül a Kubernetesre, a csapatoknak többre van szükségük az alapvető belépési szabályoknál. A Gateway API kifejező útválasztást, fejléc alapú modellválasztást és integrációs pontokat biztosít az irányelvek betartatásához – ideális többmodelles platformokhoz és fokozatos modellkibocsátáshoz.
A gyakori minták közé tartozik a súlyozott forgalomfelosztás az új modellek A/B teszteléséhez, a GPU-készletek védelmét szolgáló kérésszintű sebességkorlátozások, valamint az átjáró és a következtetési podok közötti mTLS. A horizontális pod automatikus skálázásával és a KEDA-val kombinálva a szervezetek méretezhetik a következtetési szolgáltatásokat a sormélység vagy a token átviteli sebesség alapján.
A cloudstrata Gateway API-alapú következtetési rétegeket valósít meg az OpenShift és a vanilla Kubernetes rendszeren, összekapcsolva azokat a megfigyelhetőségi, költségkövetési és vállalati azonosító rendszerekkel, így az AI-forgalom biztonságos, mérhető és gyártásra kész.
Fedezzen fel többet
ÉRINTKEZÉS
Vegye fel a kapcsolatot
Meséljen nekünk használati esetéről – egy személyre szabott következő lépéssel válaszolunk.
Célunk, hogy egy munkanapon belül válaszoljunk.
Kövesse a Cloudstratát LinkedInen és Instagramon, hogy naprakész legyen munkánkkal és nyitott pozícióinkkal.
Új lapon nyílik meg