Yapay zeka çıkarımı için kontrol düzlemi

Her isteği en uygun model, runtime ve GPU'ya yönlendirin.

Her çağrı gerçek zamanlı olarak kaliteye, gecikmeye, maliyete ve kuyruk derinliğine göre puanlanır, sonra en uygun hedefe gönderilir. vLLM, Triton, KServe ve altı runtime daha; hepsi tek API arkasında.

Her serving motorunun önünde tek API

vLLMKServeTritonRay ServeONNX RuntimeWhisper (STT)TTSGörüntüPython Local

Platform özellikleri

Üretim için tasarlanmış bileşenler

Yönlendirmeden gözleme, bütçeden otomatik ölçeklemeye kadar uçtan uca bir kontrol düzlemi.

Akıllı yönlendirme

Kalite, gecikme, maliyet, kuyruk ve soğuk başlama riskini birlikte değerlendiren çok boyutlu puanlama.

Dokuz runtime köprüsü

vLLM, KServe, Triton, Ray Serve, ONNX Runtime, Whisper, TTS, görüntü ve yerel Python — tek API arkasında.

Kiracı bazlı bütçeler

Bütçe kuralları, uyarı eşikleri, kota ve maliyet geri bildirimi ile harcama kontrolü.

A/B ve canary

Trafik bölme, canary sürümler ve metriklere dayalı otomatik yükseltme veya geri alma.

MIG ile GPU paylaşımı

NVIDIA MIG ile A100 üzerinde ince profilli bölümler: 1g.5gb — 7g.80gb aralığında esnek paylaşım.

Tahmin destekli ölçekleme

EWMA ve mevsimsellik ile yük öngörüsü, proaktif ölçekleme ve sıfıra indirgeme desteği.

Özellik deposu

Feast ile çevrimiçi özellik servisi; çıkarım sırasında modele zenginleştirilmiş girdi.

Çoklu küme

Birden fazla Kubernetes kümesinde eşgüdümlü zamanlama ve bölgesel gecikmeyi hesaba katma.

Nasıl çalışır

Dört adımda akıllı yönlendirme

Her istek kısa sürede bu hattan geçer ve en uygun hedefe eşlenir.

1

Profil çıkarma

İş yükü sınıfları (ör. hafif CPU, ağır GPU) ve bellek, GPU ile karmaşıklık ihtiyaçları çıkarılır.

2

Aday havuzu

Görev türü ve model ailesine uyan aktif dağıtımlar aday olarak toplanır; her biri olası bir hedeftir.

3

Politika süzgeci

Bütçe, gizlilik sınıfı, SLA, izin listeleri ve veri yerleşimi kuralları uygulanır.

4

Puanlama ve gönderim

Kalite, gecikme, maliyet, kuyruk ve risk boyutlarında ağırlıklı puan; en iyi aday seçilir.

Platform mimarisi

Uçtan uca yapay zeka altyapısı

İstemciden donanıma her katman, yönlendirme ve gözlemlenebilirlik için düzenlenmiştir.

  • WorkloadProfiler
  • CandidateGenerator
  • PolicyEngine
  • ScoringEngine
  • Dispatcher
  • Canary trafik bölme

Veri katmanı

PostgreSQL · Redis · Feast · Prometheus

Entegrasyon

Birkaç satırla başlayın

Tek uç noktadan modellere erişin; yönlendirme ve ölçekleme platformda kalır.

Python
from wacke import Client

client = Client(api_key="sk-...")

# One endpoint — wacke scores quality, latency,
# cost and queue depth, then routes to the best
# model + runtime + GPU for this request.
resp = client.inference.create(
    task_type="chat_completion",
    messages=[{"role": "user", "content": "Summarize Q3 revenue"}],
    objective="balanced",   # cost | balanced | quality
    max_tokens=512,
)

print(resp.output)
print(resp.routing.runtime, resp.cost.usd)

Yapay zeka iş yüklerinizi ölçeklendirmeye hazır olun

Araştırmadan kurumsal kullanıma, iş yüklerinizi verimli ve ölçülebilir biçimde yönetin.