Bu değer yaklaşık hesaplamadır. Gerçek token sayısı modele ve tokenizer'a göre değişir.
Bu sayı ne işe yarar?
AI araçları metni kelime değil token olarak işler. Girdi çok uzunsa bağlam kesilebilir veya API maliyeti artar. Bu araç uzun metni parçalara ayırmadan önce fikir verir.
Türkçe neden daha çok token harcar?
Türkçe sondan eklemeli bir dil. "Ev" kısacık bir kelime, ama "evlerinizden" tek bir kelime olarak yazıldığı hâlde tokenizer onu genellikle birkaç parçaya böler. İngilizcede aynı anlamı taşıyan "from your houses" üç ayrı kelimedir ve çoğu zaman üç token eder. Sonuç şu: ekranda daha kısa duran Türkçe metin, modelin gözünde İngilizce karşılığından daha pahalı olabilir.
Buna bir de Türkçeye özgü harfler ekleniyor. ç, ğ, ı, ö, ş, ü karakterleri İngilizce ağırlıklı sözlüklerde daha seyrek geçtiği için ayrı parçalara ayrılma ihtimalleri yüksek. Bu yüzden aynı uzunluktaki iki metinden Türkçe olanı çoğu zaman daha fazla token tüketir. Yukarıdaki tahmin bu farkı kabaca yansıtır; kesin sayı için kullandığın modelin kendi aracına bak.
Sayıyı gördükten sonra ne yapmalı?
Tahmini token sayısını, kullandığın modelin bir seferde okuyabildiği sınırla karşılaştır. Sayı sınıra yaklaşıyorsa metnin tamamının okunduğunu varsayma. Böyle durumlarda iki yol var: metni anlamlı parçalara bölüp sırayla vermek, ya da önce gereksiz kısımları temizlemek. İçindekiler tablosu, tekrar eden başlıklar, imza blokları ve alakasız ekler genelde ilk atılacak yerlerdir.
Uzun belgelerde şu sıralama işe yarıyor: önce ne öğrenmek istediğini bir cümleyle yaz, sonra sadece o soruyla ilgili bölümleri yapıştır. Modelin her şeyi okuyup doğru yeri bulmasını beklemek yerine doğru yeri kendin seçmek hem daha ucuz hem daha isabetli oluyor.
Son bir not: token sayısı sadece sınırla ilgili değil, maliyetle de ilgili. API üzerinden çalışıyorsan hem gönderdiğin metin hem de gelen yanıt ayrı ayrı faturalandırılır. Bu yüzden aynı belgeyi her soruda baştan yapıştırmak yerine bir kez özetletip özet üzerinden devam etmek, hem daha ucuz hem daha isabetli sonuç verir.
Sık sorulanlar
Bu tahmin ne kadar güvenilir?
Yön göstermek için yeterli, faturalandırma için değil. Her modelin tokenizer'ı farklı çalışır; buradaki sayı ile gerçek sayı arasında yüzde on ile yirmi arası fark olması normaldir. Kesin rakam gerekiyorsa kullandığın modelin resmi aracıyla doğrula.
Yazdığım metin bir yere gönderiliyor mu?
Hayır. Hesaplama tamamen tarayıcında yapılır, metin sunucuya gitmez ve kaydedilmez. Yine de başkasına ait kişisel veriler ve şirket içi bilgiler konusunda genel bir dikkat kuralı olarak temkinli ol.
Modelin verdiği cevap da token sayılır mı?
Evet, ücretlendirmede girdi ve çıktı ayrı ayrı sayılır. Buradaki hesap yalnızca senin yapıştırdığın metni, yani girdiyi tahmin eder. Uzun cevap isteyeceksen toplam kullanımın bu sayının üzerine çıkacağını hesaba kat.