Inference (LLM)
OpenAI-uyumlu LLM uçları — base URL, kimlik ve tam örnek.
Gao Kaptan inference OpenAI-uyumludur: OpenAI SDK'sını ya da düz curl'ü, yalnızca base URL'i
ve API anahtarını değiştirerek kullanabilirsiniz.
Base URL
https://kaptan.isnet.net.tr/api/v1/inference/v1OpenAI istemcisinde base_url (ya da OPENAI_BASE_URL) bu değer olmalı. Sondaki /v1 segmenti dahildir
— OpenAI SDK'sı yolları buna ekler (/v1/chat/completions). Anahtarı Inference → API Anahtarları
sayfasından alırsınız ve Authorization: Bearer <anahtar> ile gönderirsiniz.
Örnek — chat/completions
curl -s https://kaptan.isnet.net.tr/api/v1/inference/v1/chat/completions \
-H "Authorization: Bearer sk-..." \
-H "Content-Type: application/json" \
-d '{
"model": "Qwen/Qwen3.6-35B-A3B-FP8",
"messages": [{"role": "user", "content": "Selam"}],
"max_tokens": 256,
"chat_template_kwargs": {"enable_thinking": false}
}'Düşünen modeller (Qwen3.x) için
chat_template_kwargs.enable_thinking: falseopsiyoneldir ama önerilir: kapalı değilken model çıktısını düşünmeye harcayıpcontent: nulldönebilir. Kısamax_tokensile bu daha belirgindir.
OpenAI-uyumlu uçlar
Hepsi base URL'e görecelidir (.../api/v1/inference/v1).
| Method | Yol | Açıklama |
|---|---|---|
| POST | /api/v1/inference/v1/chat/completions | Sohbet tamamlama |
| POST | /api/v1/inference/v1/completions | Metin tamamlama |
| POST | /api/v1/inference/v1/embeddings | Gömme (embedding) vektörü |
| GET | /api/v1/inference/v1/models | Kullanılabilir modeller (OpenAI biçimi) |
| GET | /api/v1/inference/v1/usage | Kendi kullanımın (token, maliyet) |
Playground uçları
Uygulama içi denemenin (JWT oturumu) kullandığı uçlar — dışarıdan API anahtarıyla çağrılmaz.
| Method | Yol | Açıklama |
|---|---|---|
| POST | /api/v1/inference/v1/pg/chat/completions | Playground sohbet |
| POST | /api/v1/inference/v1/pg/embeddings | Playground gömme |
| GET | /api/v1/inference/v1/pg/usage | Playground kullanım |
Modeller
| Method | Yol | Açıklama |
|---|---|---|
| GET | /api/v1/inference/models | Modeller (Gao Kaptan biçimi, fiyat/tip dahil) |
| GET | /api/v1/inference/models/public | Herkese açık model listesi |
API anahtarları
| Method | Yol | Açıklama |
|---|---|---|
| GET | /api/v1/inference/keys | Anahtarları listele |
| POST | /api/v1/inference/keys | Yeni anahtar oluştur |
| DELETE | /api/v1/inference/keys/:id | Anahtarı sil |
| POST | /api/v1/inference/keys/:id/revoke | Anahtarı iptal et |
| POST | /api/v1/inference/keys/:id/rotate | Anahtarı döndür |
| POST | /api/v1/inference/keys/:id/select | Etkin anahtarı seç |
Küme içinden erişim (kapalı-mod)
İnterneti kapalı bir pod (belgeleri dışarı çıkmasın isteyen kurulumlar) yukarıdaki public adrese ulaşamaz. Bunun yerine, küme içindeki inference vekiline kendi API anahtarıyla gider:
http://inference-proxy.kaptan-inference.svc.cluster.local:8080/v1/chat/completionsGövde ve Authorization aynıdır; vekil yalnızca isteği taşır, anahtarı saklamaz ve kullanım yine
sizin adınıza faturalanır. Ayrıntı: Örnekler ve
deploy/inference-proxy/README.md.

Gao Kaptan Docs