
Her isteği en uygun model, runtime ve GPU'ya yönlendirin.
Her çağrı gerçek zamanlı olarak kaliteye, gecikmeye, maliyete ve kuyruk derinliğine göre puanlanır, sonra en uygun hedefe gönderilir. vLLM, Triton, KServe ve altı runtime daha; hepsi tek API arkasında.
Her serving motorunun önünde tek API
Platform özellikleri
Üretim için tasarlanmış bileşenler
Yönlendirmeden gözleme, bütçeden otomatik ölçeklemeye kadar uçtan uca bir kontrol düzlemi.
Akıllı yönlendirme
Kalite, gecikme, maliyet, kuyruk ve soğuk başlama riskini birlikte değerlendiren çok boyutlu puanlama.
Dokuz runtime köprüsü
vLLM, KServe, Triton, Ray Serve, ONNX Runtime, Whisper, TTS, görüntü ve yerel Python — tek API arkasında.
Kiracı bazlı bütçeler
Bütçe kuralları, uyarı eşikleri, kota ve maliyet geri bildirimi ile harcama kontrolü.
A/B ve canary
Trafik bölme, canary sürümler ve metriklere dayalı otomatik yükseltme veya geri alma.
MIG ile GPU paylaşımı
NVIDIA MIG ile A100 üzerinde ince profilli bölümler: 1g.5gb — 7g.80gb aralığında esnek paylaşım.
Tahmin destekli ölçekleme
EWMA ve mevsimsellik ile yük öngörüsü, proaktif ölçekleme ve sıfıra indirgeme desteği.
Özellik deposu
Feast ile çevrimiçi özellik servisi; çıkarım sırasında modele zenginleştirilmiş girdi.
Çoklu küme
Birden fazla Kubernetes kümesinde eşgüdümlü zamanlama ve bölgesel gecikmeyi hesaba katma.
Nasıl çalışır
Dört adımda akıllı yönlendirme
Her istek kısa sürede bu hattan geçer ve en uygun hedefe eşlenir.
Profil çıkarma
İş yükü sınıfları (ör. hafif CPU, ağır GPU) ve bellek, GPU ile karmaşıklık ihtiyaçları çıkarılır.
Aday havuzu
Görev türü ve model ailesine uyan aktif dağıtımlar aday olarak toplanır; her biri olası bir hedeftir.
Politika süzgeci
Bütçe, gizlilik sınıfı, SLA, izin listeleri ve veri yerleşimi kuralları uygulanır.
Puanlama ve gönderim
Kalite, gecikme, maliyet, kuyruk ve risk boyutlarında ağırlıklı puan; en iyi aday seçilir.
Platform mimarisi
Uçtan uca yapay zeka altyapısı
İstemciden donanıma her katman, yönlendirme ve gözlemlenebilirlik için düzenlenmiştir.
- WorkloadProfiler
- CandidateGenerator
- PolicyEngine
- ScoringEngine
- Dispatcher
- Canary trafik bölme
Veri katmanı
PostgreSQL · Redis · Feast · Prometheus
Entegrasyon
Birkaç satırla başlayın
Tek uç noktadan modellere erişin; yönlendirme ve ölçekleme platformda kalır.
from wacke import Client
client = Client(api_key="sk-...")
# One endpoint — wacke scores quality, latency,
# cost and queue depth, then routes to the best
# model + runtime + GPU for this request.
resp = client.inference.create(
task_type="chat_completion",
messages=[{"role": "user", "content": "Summarize Q3 revenue"}],
objective="balanced", # cost | balanced | quality
max_tokens=512,
)
print(resp.output)
print(resp.routing.runtime, resp.cost.usd)Yapay zeka iş yüklerinizi ölçeklendirmeye hazır olun
Araştırmadan kurumsal kullanıma, iş yüklerinizi verimli ve ölçülebilir biçimde yönetin.