gaogaoGao Kaptan Docsv0.90.x
Kavramlar

Yapay zekâ modelleri

Kaptan üzerinde çalışan modeller, hangisi ne için kullanılır ve ölçülmüş performansları.

Gao Kaptan'daki yapay zekâ modelleri kendi donanımımızda çalışır. İstekleriniz hiçbir dış sağlayıcıya gitmez; veri Gao Kaptan altyapısının dışına çıkmaz.

Tüm modeller açık ağırlıklı (Apache-2.0) Qwen ailesindendir.

Hangi model ne için?

ModelNe içinBağlamÖne çıkan
Qwen3.8-27BGenel sohbet, ajan görevleri, araç kullanımı, görsel anlama128K tokenGörsel girdi, araç çağırma, adım adım düşünme
Qwen3.6-35B-A3BHızlı işler: özetleme, başlık üretme, sınıflandırma, yönlendirme128K tokenYaklaşık 2 kat hızlı, araç çağırma ve düşünme destekli
Qwen3-Embedding-4BArama, benzerlik, RAG8K token100'den fazla dil
Qwen3-Reranker-0.6BArama sonuçlarını alaka sırasına dizme16K tokenRAG kalitesini belirgin artırır

İki sohbet modeli arasındaki seçim bir kalite/hız takasıdır. Qwen3.8-27B daha yeni ve daha güçlü; Qwen3.6-35B-A3B belirgin şekilde daha hızlı. Kısa ve tekrar eden işler için ikincisi, zor akıl yürütme ve görsel işler için birincisi.

Ölçülmüş performans

Aşağıdaki değerler 2026-08-24 tarihinde, tek bir NVIDIA H200 üzerinde vllm bench serve ile ölçülmüştür. Sentetik yük (512 token girdi / 256 token çıktı) kullanılmıştır.

Tek istek — boşta sistemde

ModelÜretim hızıİlk token gecikmesi
Qwen3.8-27B~122 token/sn106 ms
Qwen3.6-35B-A3B~252 token/sn116 ms

32 eşzamanlı istek

ModelToplam üretimOrtalama ilk tokenMedyan ilk tokenİstek/dakika
Qwen3.8-27B1561 token/sn517 ms303 ms~366
Qwen3.6-35B-A3B2209 token/sn334 ms327 ms~517

Test edilen tüm senaryolarda başarısız istek olmadı; yük arttıkça sistem yavaşlar ama istek düşürmez.

Embedding

MetrikDeğer
İstek verimi124 istek/sn
Token verimi63.605 token/sn
Medyan gecikme358 ms
P99 gecikme487 ms

(50 eşzamanlı istek, 512 token girdi)

Uzun bağlamda ne bekleyin

Modeller 128K token bağlamı destekler, ancak çok uzun istemler belirgin şekilde yavaşlar — bu tüm LLM servisleri için geçerli bir fizik kuralıdır: modelin cevaba başlamadan önce tüm girdiyi işlemesi gerekir.

Kabaca beklenti (aynı anda çok sayıda uzun istek gönderildiğinde):

İstem uzunluğuİlk token gecikmesi
~500 tokenyarım saniyenin altı
~8.000 tokenonlarca saniye
~32.000 tokendakikalar

İnteraktif kullanımda istemi kısa tutmak gecikmeyi doğrudan düşürür. Uzun dokümanlarla çalışıyorsanız, tamamını istemin içine koymak yerine embedding + reranker ile yalnızca ilgili parçaları seçmek hem çok daha hızlı hem daha isabetlidir.

Nasıl çağırılır?

Modeller OpenAI-uyumlu uçlar üzerinden çağrılır. model alanına yukarıdaki adı yazmanız yeterlidir:

{
  "model": "Qwen/Qwen3.8-27B-FP8",
  "messages": [{ "role": "user", "content": "Merhaba" }]
}

Uç adresleri ve kimlik doğrulama için API Referansı → Inference, arayüzden kullanım için LLM Servisi sayfasına bakın.

Ücretlendirme

Yapay zekâ kullanımı token başına ücretlendirilir ve şirket bakiyenizden düşülür. Ayrıntılar için Fiyatlandırma.

Bu sayfa yardımcı oldu mu?

On this page