ufak AI’dan Türkçe dil modeli
ufakzeka-1
Sıfırdan eğitilmiş, 151M parametreli Türkçe dil modeli. Ağırlıkları ve eğitim tarifi açık; Apache-2.0 lisanslı.
- 151Mparametre
- 13,5 milyarön eğitim tokenı
- < 300 $toplam maliyet
- Apache-2.0lisans
Modelle örnek sohbetler
Aynı düzenekte ölçüldü
Kendi modellerimizi ve karşılaştırdığımız modelleri aynı düzenekle ölçtük. Türkçe eğitilmiş üç model yedi görevin dördünde rastgele tahminin belirgin biçimde üstüne çıkmakta, üçünde ise ona yakın kalmaktadır; Qwen2.5-0.5B yalnızca TurBLiMP’te belirgin biçimde üstündedir. ARC-e ve XCOPA’da ufakzeka-1, kendisinin beş katı büyüklüğündeki iki Türkçe modelin üç puandan az gerisinde; dil bilgisini ölçen TurBLiMP’te ise 5 ile 8 puan gerisindedir.
Taşlar parametre sayısıyla orantılıdır.
| Model | Parametre | HellaSwag | ARC-c | ARC-e | XCOPA | Belebele | TurBLiMP | TurkishMMLU |
|---|---|---|---|---|---|---|---|---|
| ufakzeka-1 | 151M | 33.2 | 27.6 | 38.8 | 59.8 | 27.4 | 90.1 | 23.3 |
| ufakzeka-1-base | 151M | 35.3 | 27.6 | 39.1 | 60.0 | 27.6 | 92.4 | 19.2 |
| Kanarya-750M | 750M | 37.8 | 26.5 | 41.4 | 61.2 | 23.4 | 95.3 | 16.2 |
| turkish-gpt2-large | 774M | 35.3 | 25.4 | 40.4 | 60.6 | 22.4 | 98.2 | 19.0 |
| Qwen2.5-0.5B | 494M | 29.2 | 23.6 | 28.6 | 54.6 | 29.9 | 70.0 | 18.2 |
| Rastgele tahmin | 25 | 25 | 25 | 50 | 25 | 50 | 20 |
Bütün modeller aynı düzenekle ve örnek gösterilmeden (zero-shot) ölçülmüştür; puan, modelin doğru seçeneği en olası bulduğu soruların yüzdesidir. HellaSwag ve ARC için uzunluğa göre normalize edilmiş doğruluk (length-normalised accuracy), diğerleri için ham doğruluk kullanılmıştır. TurBLiMP 16 alt kümenin, TurkishMMLU 9 alanın ortalamasıdır. Ayrıntılar model kartındadır.
Para nereye gitti
Toplam ve API tutarı faturalardan alındı; ön eğitim tutarı çalışma saatlerinin liste fiyatıyla hesaplandı, ince ayar ve değerlendirme kalan tutardır. Ön eğitim ağustosta, ince ayar ve ölçümler eylülde yapıldı. Ayrıntılı harcama defteri repoda bulunmaktadır.
Neyi yapamaz
- Bilmediği bilgileri uydurur. Ankara–İstanbul mesafesini sorarsanız bilmediğini söylemek yerine bir sayı verir. Yalnızca öğretildiği konularda “bilmiyorum” der: saat, tarih, hava, haber, fiyat, kişisel bilgi, gelecek. Yemek tariflerindeki ölçüler de güvenilir değildir.
- Kod yazamaz. Python istediğinizde düzyazı üretir.
- Aritmetiği tek soruda, adımlarını yazarak yapar. Aynı hesabı “emin misin” diye sorarsanız işlemi doğru tekrarlayıp sonuç satırına yanlış sayı yazabilir. Her mesajda tek hesap sorun.
- Uzun bir hikâyeden sonra kimin kim olduğunu karıştırabilir: 200 sohbet üzerinde yapılan denemede 38 sohbette kullanıcının adını hikâyedeki bir adla karıştırdı ya da daha önce söylenen adı kullanmayı sürdürdü.
- 2026 yazından sonrasını bilmez.
Çalıştırın
Mimari standart Qwen3’tür; transformers ile ek kod gerekmez. GGUF dosyaları 18 Eylül 2026’dan sonra derlenen llama.cpp ile doğrudan çalışmaktadır; ayrıntılar dokümantasyondadır.
llama-cli -m ufakzeka-1-q8_0.gguf --temp 0.3 --top-k 40 --top-p 0.9 --repeat-penalty 1.0 --dry-multiplier 0 -n 520