Gateway API voor AI-inferentie: LLM-verkeer routeren op Kubernetes
Naarmate de LLM-gevolgtrekking overgaat op Kubernetes, hebben teams meer nodig dan alleen de basisregels van Ingress. De Gateway API biedt expressieve routering, op headers gebaseerde modelselectie en integratiepunten voor beleidshandhaving, ideaal voor platforms met meerdere modellen en geleidelijke modelimplementaties.
Veelvoorkomende patronen zijn onder meer gewogen verkeerssplitsingen voor het A/B-testen van nieuwe modellen, snelheidslimieten op aanvraagniveau om GPU-pools te beschermen, en mTLS tussen gateway- en inferentiepods. Gecombineerd met Horizontal Pod Autoscaling en KEDA kunnen organisaties inferentieservices schalen op basis van wachtrijdiepte of tokendoorvoer.
cloudstrata implementeert op Gateway API gebaseerde inferentielagen op OpenShift en vanille Kubernetes en verbindt deze met observatie-, kostenregistratie- en bedrijfsidentiteitssystemen, zodat AI-verkeer veilig, meetbaar en productieklaar is.
Ontdek meer
CONTACT
Neem contact op
Vertel ons over uw gebruiksscenario. Wij reageren met een op maat gemaakte volgende stap.
Wij streven ernaar om binnen één werkdag te reageren.
Volg Cloudstrata op LinkedIn en Instagram om op de hoogte te blijven van ons werk en onze vacatures.
Opent in een nieuw tabblad