Yapay zekâ modelleri
Kaptan üzerinde çalışan modeller, hangisi ne için kullanılır ve ölçülmüş performansları.
Gao Kaptan'daki yapay zekâ modelleri kendi donanımımızda çalışır. İstekleriniz hiçbir dış sağlayıcıya gitmez; veri Gao Kaptan altyapısının dışına çıkmaz.
Tüm modeller açık ağırlıklı (Apache-2.0) Qwen ailesindendir.
Hangi model ne için?
| Model | Ne için | Bağlam | Öne çıkan |
|---|---|---|---|
| Qwen3.8-27B | Genel sohbet, ajan görevleri, araç kullanımı, görsel anlama | 128K token | Görsel girdi, araç çağırma, adım adım düşünme |
| Qwen3.6-35B-A3B | Hızlı işler: özetleme, başlık üretme, sınıflandırma, yönlendirme | 128K token | Yaklaşık 2 kat hızlı, araç çağırma ve düşünme destekli |
| Qwen3-Embedding-4B | Arama, benzerlik, RAG | 8K token | 100'den fazla dil |
| Qwen3-Reranker-0.6B | Arama sonuçlarını alaka sırasına dizme | 16K token | RAG kalitesini belirgin artırır |
İki sohbet modeli arasındaki seçim bir kalite/hız takasıdır. Qwen3.8-27B daha yeni ve daha güçlü; Qwen3.6-35B-A3B belirgin şekilde daha hızlı. Kısa ve tekrar eden işler için ikincisi, zor akıl yürütme ve görsel işler için birincisi.
Ölçülmüş performans
Aşağıdaki değerler 2026-08-24 tarihinde, tek bir NVIDIA H200 üzerinde vllm bench serve
ile ölçülmüştür. Sentetik yük (512 token girdi / 256 token çıktı) kullanılmıştır.
Tek istek — boşta sistemde
| Model | Üretim hızı | İlk token gecikmesi |
|---|---|---|
| Qwen3.8-27B | ~122 token/sn | 106 ms |
| Qwen3.6-35B-A3B | ~252 token/sn | 116 ms |
32 eşzamanlı istek
| Model | Toplam üretim | Ortalama ilk token | Medyan ilk token | İstek/dakika |
|---|---|---|---|---|
| Qwen3.8-27B | 1561 token/sn | 517 ms | 303 ms | ~366 |
| Qwen3.6-35B-A3B | 2209 token/sn | 334 ms | 327 ms | ~517 |
Test edilen tüm senaryolarda başarısız istek olmadı; yük arttıkça sistem yavaşlar ama istek düşürmez.
Embedding
| Metrik | Değer |
|---|---|
| İstek verimi | 124 istek/sn |
| Token verimi | 63.605 token/sn |
| Medyan gecikme | 358 ms |
| P99 gecikme | 487 ms |
(50 eşzamanlı istek, 512 token girdi)
Uzun bağlamda ne bekleyin
Modeller 128K token bağlamı destekler, ancak çok uzun istemler belirgin şekilde yavaşlar — bu tüm LLM servisleri için geçerli bir fizik kuralıdır: modelin cevaba başlamadan önce tüm girdiyi işlemesi gerekir.
Kabaca beklenti (aynı anda çok sayıda uzun istek gönderildiğinde):
| İstem uzunluğu | İlk token gecikmesi |
|---|---|
| ~500 token | yarım saniyenin altı |
| ~8.000 token | onlarca saniye |
| ~32.000 token | dakikalar |
İnteraktif kullanımda istemi kısa tutmak gecikmeyi doğrudan düşürür. Uzun dokümanlarla çalışıyorsanız, tamamını istemin içine koymak yerine embedding + reranker ile yalnızca ilgili parçaları seçmek hem çok daha hızlı hem daha isabetlidir.
Nasıl çağırılır?
Modeller OpenAI-uyumlu uçlar üzerinden çağrılır. model alanına yukarıdaki adı yazmanız
yeterlidir:
{
"model": "Qwen/Qwen3.8-27B-FP8",
"messages": [{ "role": "user", "content": "Merhaba" }]
}Uç adresleri ve kimlik doğrulama için API Referansı → Inference, arayüzden kullanım için LLM Servisi sayfasına bakın.
Ücretlendirme
Yapay zekâ kullanımı token başına ücretlendirilir ve şirket bakiyenizden düşülür. Ayrıntılar için Fiyatlandırma.

Gao Kaptan Docs