Gateway API for AI Inference: Routing LLM Traffic on Kubernetes
Оскільки висновок LLM переходить на Kubernetes, командам потрібно більше, ніж базові правила Ingress. API шлюзу забезпечує експресивну маршрутизацію, вибір моделі на основі заголовка та точки інтеграції для застосування політики — ідеально підходить для багатомодельних платформ і поступового розгортання моделі.
Загальні шаблони включають зважений розподіл трафіку для A/B-тестування нових моделей, обмеження швидкості на рівні запиту для захисту пулів GPU та mTLS між шлюзом і блоками висновків. У поєднанні з Horizontal Pod Autoscaling і KEDA організації можуть масштабувати послуги висновків на основі глибини черги або пропускної здатності маркерів.
cloudstrata реалізує рівні висновку на основі API шлюзу на OpenShift і ванільному Kubernetes, підключаючи їх до спостережуваності, відстеження витрат і корпоративних систем ідентифікації, щоб трафік ШІ був безпечним, вимірюваним і готовим до виробництва.
Досліджуйте більше
КОНТАКТ
Зв'яжіться
Розкажіть нам про свій варіант використання — ми відповімо індивідуальним наступним кроком.
Ми прагнемо відповісти протягом одного робочого дня.
Слідкуйте за Cloudstrata в LinkedIn та Instagram, щоб бути в курсі нашої роботи та відкриття.
Відкривається в новій вкладці