Orhun sıfırdan yazılmış Türkçe dil modeli ailesi.

Hazır bir yabancı modeli alıp Türkçeye ince ayar yapmadık. Kelimeleri parçalara ayıran sözlüğünden mimarisine, verisinden eğitimine kadar her adımı kendi ekibimiz kurdu; her şey yerli altyapıda çalıştı, veri dışarı çıkmadı.

Bugün "Türkçe model" olarak sunulan sistemlerin çoğu, aslında yabancı bir base modelin üzerine yapılmış bir fine-tune'dan ibaret. Tokenizer başka bir dil için tasarlanmış, mimari olduğu gibi devralınmış, veri hazırlığı bile çoğu zaman dış API'lere emanet ediliyor.

Orhun'u biz bambaşka bir yoldan kurduk: önce tokenizer'ı Türkçenin morfolojisine göre sıfırdan eğittik, ardından decoder mimarisini kendimiz tasarladık; veriyi kendi pipeline'ımızda toplayıp ön-eğitimin tamamını yerli altyapıda çalıştırdık.

Sonuç ortada: 500 milyon parametrelik Cevher, benchmark'larda kendinden 4 ve 15 kat büyük modelleri geride bırakıyor.

Tokenizer'ı iş başında görün

Dil modelleri metni token denilen parçalara bölerek okur; parça azaldıkça model daha hızlı ve ucuz çalışır. Bir örnek seçin, Orhun'un Türkçeyi ne kadar bütün böldüğünü kendi gözünüzle görün.

Çekoslovakyalılaştıramadıklarımızdan mısınız?

Orhun bu metni 7 parçada yazıyor; rakipler 17 ile 29 parça arasında kalıyor.

Orhun-64k7 parça_Çekoslovakyalaştıramadıklarımızdan_mısınız?
Gemma-2B17 parçaÇekoslovakyalılaşramadıklarımızdan_mısınız?
Qwen2-7B19 parçaÃĩekoslovakyalılaÅŁtıramadıklarımızdanĠmısınız?
Llama-3-8B19 parçaÃĩekoslovakyalılaÅŁtıramadıklarımızdanĠmısınız?
DeepSeek-7B29 parçaÃĩekoslovakyalılaÅŁtıramadıklarımızdanĠmısınız?

Parça sayısı (az olan iyi)

Orhun-64k7
Gemma-2B17 Orhun %58,8 daha az
Qwen2-7B19 Orhun %63,2 daha az
Llama-3-8B19 Orhun %63,2 daha az
DeepSeek-7B29 Orhun %75,9 daha az

Çıktılar test edilmiş gerçek sonuçlardır; bozuk görünen karakterler hata değil, kelimenin bayt düzeyinde kırpıldığının göstergesidir.

Rakamlarla Cevher

İddia bizim değil, ölçümlerin: doğru kurulmuş küçük bir model, kendinden kat kat büyüklerini geçebiliyor.

36,65

Cetvel Türkçe puanı

20 görevlik testte 4 kat büyük Kumru'yu da 15 kat büyük Trendyol'u da geçti; eğrisi hemen altta.

89,7

Yazım düzeltmede zirve

Türkçe yazım ve dil bilgisi düzeltmede bu kategoride bilinen en yüksek puan.

343 MB

Cebe sığan boyut

Tek dosya; internetsiz ve GPU'suz, telefonun kendi işlemcisinde çalışır.

2 GPU

Bir günde ön-eğitim

Tüm ön-eğitim yerli altyapıda, dış API kullanılmadan yaklaşık bir günde tamamlandı.

Cetvel GENEL: model büyüdükçe puan düşüyor

Üç model de aynı düzenekte, aynı sohbet şablonuyla ölçüldü; eksen fark okunabilsin diye 30'dan başlıyor.Tüm sonuçlar ve ölçüm yöntemi

Verinin dışarı çıkamadığı her yerde

Cevher internetsiz ve bulutsuz, cihazın kendi işlemcisinde çalışır. Veri cihazdan hiç ayrılmadığı için bulutun giremediği yerlerde de kullanılabilir:

Telefon ve tablet
Araç içi sistemler
Akıllı ev
Kiosk ve saha cihazları
KVKK kapsamındaki kurumsal bilgisayarlar

Cevher her konuda konuşan bir ansiklopedi değil; tek bir işi güvenilir biçimde yapan asistanların temeli. Onu kendi görevinize göre uzmanlaştırırsınız ve başlamanın iki yolu var:

Hazır API ile

Modeli geliştirici platformu üzerinden kendi uygulamanızdan hemen çağırmaya başlarsınız; kurulum gerektirmez, dakikalar içinde ilk yanıtı alırsınız.

Size özel eğitimle

Kendi verinizi getirirsiniz; Cevher sizin göreviniz için eğitilir. Uzmanlaştırma yaklaşık bir iş günü sürer; örneğin araç çağırma eğitimi 25 dakikada tamamlandı.

Hangi yolu seçerseniz seçin, projeye dönüştürme işini TurkDeep üstlenir.