API gateway per inferenza AI: instradamento del traffico LLM su Kubernetes
Man mano che l'inferenza LLM si sposta su Kubernetes, i team necessitano di qualcosa di più delle semplici regole Ingress. L'API Gateway fornisce routing espressivo, selezione di modelli basati su intestazioni e punti di integrazione per l'applicazione delle policy, ideali per piattaforme multimodello e implementazioni graduali dei modelli.
I modelli comuni includono suddivisioni ponderate del traffico per il test A/B di nuovi modelli, limiti di velocità a livello di richiesta per proteggere i pool GPU e mTLS tra gateway e pod di inferenza. In combinazione con la scalabilità orizzontale dei pod e KEDA, le organizzazioni possono scalare i servizi di inferenza in base alla profondità della coda o alla velocità effettiva dei token.
cloudstrata implementa livelli di inferenza basati su API Gateway su OpenShift e Vanilla Kubernetes, collegandoli a osservabilità, monitoraggio dei costi e sistemi di identità aziendale in modo che il traffico AI sia sicuro, misurabile e pronto per la produzione.
Esplora di più
CONTATTO
Mettiti in contatto
Raccontaci il tuo caso d'uso: ti risponderemo con un passaggio successivo su misura.
Puntiamo a rispondere entro un giorno lavorativo.
Segui Cloudstrata su LinkedIn e Instagram per restare aggiornato sul nostro lavoro e sulle posizioni aperte.
Si apre in una nuova scheda