API de passerelle pour l'inférence IA : routage du trafic LLM sur Kubernetes
À mesure que l’inférence LLM passe à Kubernetes, les équipes ont besoin de plus que des règles Ingress de base. L'API Gateway fournit un routage expressif, une sélection de modèles basée sur les en-têtes et des points d'intégration pour l'application des politiques, ce qui est idéal pour les plates-formes multimodèles et les déploiements progressifs de modèles.
Les modèles courants incluent des répartitions pondérées du trafic pour les tests A/B de nouveaux modèles, des limites de débit au niveau des requêtes pour protéger les pools GPU et mTLS entre la passerelle et les pods d'inférence. En combinaison avec Horizontal Pod Autoscaling et KEDA, les organisations peuvent faire évoluer les services d'inférence en fonction de la profondeur de la file d'attente ou du débit des jetons.
cloudstrata implémente des couches d'inférence basées sur l'API Gateway sur OpenShift et Vanilla Kubernetes, en les connectant aux systèmes d'observabilité, de suivi des coûts et d'identité d'entreprise afin que le trafic d'IA soit sécurisé, mesurable et prêt pour la production.
Explorer davantage
CONTACT
Entrer en contact
Parlez-nous de votre cas d'utilisation – nous vous répondrons avec une prochaine étape personnalisée.
Nous visons à répondre dans un délai d’un jour ouvrable.
Suivez Cloudstrata sur LinkedIn et Instagram pour rester informé de notre travail et de nos offres.
S’ouvre dans un nouvel onglet