İçeriğe geç
Dolphy
Test ve Ölçüm

Yapay Zekâ Modeli Seçerken Hız Ölçümü Nasıl Yanıltır? GPT-6 Luna, GPT-5.6 ve Gemini

Mustafa Gürbüz7 dk okuma
Grafikli laptop, yan yana üç kronometre ve sunucu; üstte “Yapay zekâ modeli seçerken hız ölçümü nasıl yanıltır?” başlığı

Her ay yeni bir model çıkıyor ve çoğu "daha hızlı, daha ucuz" diye duyuruluyor. Müşteri asistanında model değiştirmek cazip: sesli kanalda her 200 milisaniye hissediliyor, fatura her konuşmayla büyüyor.

Dolphy'de bir asistanın çalışması için birden fazla model görev alıyor: misafirin mesajını sınıflandıran küçük bir model, cevabı yazan model, site içeriğini işleyen model ve görüşme sonrası analizi yapan model. Bu yazıda bu roller için yaptığımız hız ve kalite ölçümlerini, özellikle de ölçümün bizi yanılttığı anları anlatıyoruz.

"Yeni sürüm daha hızlı" varsayımı

Sesli kanal için ilk ölçüm sunucumuzdan, gerçek sesli promptla, düşünme kapalı ve beşer tekrarla yapıldı:

Model İlk yanıt süresi
gemini-2.5-flash 0,42-0,60 sn
gpt-4o-mini 0,48 sn
gemini-3.1-flash-lite 0,49-0,55 sn
gemini-3.5-flash-lite 0,59 sn
gpt-4.1-mini 0,87 sn
gpt-5.6-luna 0,86-1,13 sn
gemini-3.6-flash 0,99-1,21 sn

Tabloda yeni sürümlerin hızlı olduğuna dair bir desen yok. Bir hafta sonra aynı soruyu kaliteyle birlikte sorduk. Cevap modeli için ilk metin süresi medyanları birbirine yakındı (GPT-5.6 Luna 1.006 ms, gpt-4.1-mini 1.030 ms, gemini-2.5-flash 1.071 ms). Fark başka yerdeydi: bilgi tabanında saat ve adres bilgisi olmayan bir soruda Gemini "24 saat hizmet veriyoruz" ve "adresimiz yok" gibi cevaplar uydurdu; GPT-5.6 Luna ve 4.1-mini "bu bilgi bende yok" dedi. Luna ayrıca %21 daha ucuzdu. Cevap modeli olarak seçildi.

Bu ölçümde bir tuzağı da yakaladık. İlk karşılaştırmayı aynı süreçte arka arkaya koştuk; ikinci model, birincisinin doldurduğu cevap önbelleğini okuyordu. Sonuçlar çöpe gitti ve her model ayrı süreçte yeniden ölçüldü.

SDK ayarı sessizce yok saydı

Birkaç hafta sonra yarı fiyatlı GPT-6 Luna çıktı. İlk ölçüm şaşırtıcıydı: ilk token medyanı GPT-6'da 2.572 ms, GPT-5.6'da 1.038 ms. Yazılı test setinde tur medyanı 4,3 saniyeydi.

Sebep model değildi. Kurulu AI SDK sürümü gpt-6-* adını "düşünmeyen model" sayıyor ve düşünme seviyesi (reasoningEffort) ile hizmet sınıfı (serviceTier) alanlarını hata vermeden atıyordu. Yani GPT-6 her testte varsayılan seviyede, "medium" düşünerek çalıştı; yanıtta düşünme token'ları görünüyordu. SDK güncellenince ve ölçüm doğrudan API'ye yapılınca tablo değişti. Gerçek sesli prompt ve sekiz parçalık bilgi bloğuyla, 10'ar çağrı, sıra dönüşümlü:

Ayar İlk token medyanı p90 Düşünme token'ı
GPT-5.6 Luna, düşünme kapalı 951 ms 1.803 ms 0
GPT-6 Luna, düşünme kapalı 890 ms 2.655 ms 0
GPT-6 Luna, kapalı + hızlı mod 669 ms 1.616 ms 0
GPT-5.6 Luna, varsayılan 989 ms 2.296 ms 0
GPT-6 Luna, varsayılan (medium) 3.473 ms 5.462 ms 177
GPT-6 Luna, düşük 1.381 ms 3.114 ms 0
Aynı modelde düşünme seviyesine göre ilk token süresinin karşılaştırması
Aynı modelde düşünme seviyesine göre ilk token süresinin karşılaştırması

Aynı model, yalnız ayar farkıyla 3,5 kat yavaş. İki ders çıktı:

  • Ayarın gerçekten gittiğini doğrulayın. SDK ya da kütüphane bir alanı desteklemiyorsa hata vermeyebilir. Yanıttaki düşünme token sayısı gibi bir kanıta bakın.
  • Varsayılan ayarı bilin. GPT-6 Luna'nın varsayılan düşünme seviyesi "medium". Yalnız model adını değiştirmek sesli kanalda düşünmeyi açık bırakır.

Hızlı mod (öncelikli hizmet sınıfı) fiyatı iki katına çıkarıyor. Sesli kanalda sekizinci kelimenin gelme süresine GPT-6 için yalnız ~40 ms kazandırdı; değmedi.

Hız tamam, peki davranış?

Doğru ayarla GPT-6 Luna hızlıydı ve liste fiyatı yarıydı: 1 milyon token için giriş 0,10, çıkış 0,50 dolar (GPT-5.6 Luna 0,20 ve 1,20 dolar). Kalite ölçümü ise başka bir şey gösterdi.

Yazılı kanalda araç kullanımı. GPT-6 sayfa gösterme aracını çok daha sık çağırdı: bir klinik setinde 24 turun 11'inde kart, GPT-5.6'da 0. Her araç çağrısı ikinci bir model adımı demek; tur medyanı 3,0 saniyeden yaklaşık 4,1 saniyeye çıktı ve kart yalnız yönlendirmede gösterilmeli kuralımız (kart yazısı) ihlal edildi.

Sesli kanalda talep onayı. İki kritik vakayı dörder kez koştuk:

Vaka GPT-5.6 Luna GPT-6 Luna
Onay alınmadan talep açılmamalı 3/4 0/4
Tarih düzeltilince tek, doğru talep 4/4 0/4

Bu tablo iki karar doğurdu. GPT-6'ya geçilmedi. Ve GPT-5.6'nın da dört denemenin birinde onaysız talep açtığı görülünce kural koda taşındı (onay kapısı yazısı).

Diğer roller için de GPT-6'yı tek tek denedik:

Rol Sonuç
Sohbet sınıflandırıcısı Medyan 1.662 ms, mevcut Gemini modeli 826 ms; 35 turun 27'sinde aynı niyet; bir takip sorusunda bağlamı düşürdü
Sayfa sınıflandırma (tarama) 111 sayfanın 110'unda aynı rol; maliyet üçte bir, süre üç kat
Görüşme analizi Beş konuşmanın beşinde konuyu yanlış etiketledi
Denetim raporu Daha yumuşak puanladı ve iki gerçek bulguyu kaçırdı

Beş gün sonra yeniden

SDK'lar güncellendikten sonra, aynı gün yayımlanan diğer modellerle birlikte küçük bir karşılaştırma daha yaptık:

Model Yazılı (14 vaka) Yazılı tur p50 Sesli (14 vaka) Sesli talep akışı (10) Seste ilk token p50
GPT-5.6 Luna 14/14 2,73 sn 14/14 5/10 685 ms
GPT-6 Luna 14/14 4,16 sn 13/14 8/10 886 ms
Gemini 3.5 Flash-Lite 12/14 1,43 sn 8/14 – –
Gemini 3.8 Flash (düşük) 12/14 2,20 sn uygun değil – –

Bu kez GPT-6'nın sesli talep akışı daha iyiydi; 23 Eylül'deki onaysız talep sorunu tekrarlamadı. Ama seste ilk token yaklaşık 200 ms geride kaldı. GPT-5.6'nın talep akışındaki düşük puanın çoğu da modelden değil, hakemin hazır bir duyuru cümlesini çelişkili bulmasından geliyordu. Gemini modelleri hızlıydı ama kaynakta olmayan bilgi söyledi ("destek anında ve gece", "seksen ikiden fazla dil"). Gemini 3.7 ve 3.8 düşünmeyi "düşük"ün altına indirmediği için sesli kanala uygun değildi.

Tek koşuda ±1 vaka gürültü olduğunu bildiğimiz için sonuç "değişiklik yok, GPT-6 aday" oldu. Kısa bir canlı sesli denemede GPT-6, yan konuşma algılayan bekleme aracını yanlış tetikledi ve bir turda 11 saniyelik bir sessizlik oluştu; aynı gün GPT-5.6'ya dönüldü.

Sınıflandırıcı için de aynı turda dört modeli 16 belirsiz ve takip turunda karşılaştırdık:

Model p50 Niyet uyumu
gemini-2.5-flash (mevcut) 765 ms referans
gemini-3.5-flash-lite 885 ms 13/16
GPT-6 Luna (düşünme kapalı) 1.583 ms 15/16
gpt-4o-mini 1.216 ms 10/16

Mevcut model kaldı. Bir risk not edildi: Google 2.5 ailesini yeni hesaplara açmıyor. Kapanırsa yedek aday 3.5 Flash-Lite, ama geçişten önce niyet setiyle doğrulanmalı.

Düşünme seviyesi: hız mı, doğruluk mu?

Yazılı kanalda cevap modelinin düşünme seviyesini varsayılandan "düşük"e çekmeyi de ölçtük. Üç sette toplam sonuç iki ayarda da 55'te 51'di; ilk metin 150-500 ms erken geliyordu. Beklediğimiz kazanç 1-2 saniyeydi.

Toplamın gizlediği bir vaka vardı: diş çekiminden sonra kanaması durmayan hastanın sorusunda düşük ayar, bilgi tabanında olmayan "30 dakika ısırın" süresini ekledi. Varsayılan ayar "hekimin önerdiği süre boyunca" demişti. Kural netti: yanlış ya da eksik cevap almamak, 1 saniyelik gecikmeden önemli. Ayar açılmadı.

Model seçerken kontrol listesi

  • Ayarın gittiğini kanıtlayın. SDK sürümü, düşünme seviyesi ve önbellek seçenekleri sessizce atılabilir. Yanıttaki token dökümüne bakın.
  • Her modeli ayrı süreçte ölçün. Paylaşılan önbellek ikinci modele haksız avantaj verir.
  • Ortalama yerine dağılıma bakın. Oynak bir model ortalamada hızlı görünüp kuyrukta kaybettirebilir.
  • Uydurma testini hız testinin yanına koyun. En hızlı model bilmediği şeyi söyleyebilir.
  • Araç davranışını ölçün. Aynı prompt ve araçlarla modeller farklı sıklıkta araç çağırır; bu hem hızı hem kuralları etkiler.
  • Kritik vakaları ayrı izleyin. Toplam puan aynı kalırken en riskli vaka bozulabilir.
  • Rolleri ayrı değerlendirin. Cevap modeli için iyi olan, sınıflandırıcı ya da analiz için iyi olmayabilir.

Ölçümün sınırları

Ölçümler kendi sunucumuzdan, kendi promptlarımız ve Türkçe test setlerimizle yapıldı; başka bir kurulumda sıralama değişebilir. Test setleri 14-24 vakalık ve tek koşuda ±1 vaka gürültü var. Anthropic ve açık kaynak modeller o dönem hesabımızda anahtar olmadığı için karşılaştırmaya girmedi. Fiyatlar ölçüm tarihindeki liste fiyatları.

Sık sorulan sorular

Bu bölümdeki sorular, aynı konuda en sık arananlardan derlendi.

01

Müşteri asistanı için en hızlı yapay zekâ modeli hangisi?

Tek bir cevap yok; hız promptun uzunluğuna, düşünme ayarına ve sağlayıcının o anki yüküne bağlı. Bizim ölçümümüzde düşünme kapalıyken GPT-5.6 Luna ve GPT-6 Luna ilk token'da 0,9-1 saniye civarındaydı; GPT-6 varsayılan ayarında 3,5 saniyeye çıktı. Kendi promptunuzla, dağılıma bakarak ölçün.

02

Yeni model çıkınca hemen geçmeli miyim?

Önce kendi test setinizle kaliteyi, araç davranışını ve kritik vakaları ölçün. Bizim deneyimimizde yarı fiyatlı ve hızlı bir model, talep onayı ve kart gösterme gibi kurallarda farklı davrandı ve geçiş ertelendi.

03

Düşünme (reasoning) seviyesini düşürmek güvenli mi?

Toplam kalite aynı kalabilir ama tek tek kritik vakalarda fark çıkabilir. Bizim ölçümümüzde düşük seviye bir tıbbi acil durum sorusunda kaynakta olmayan bir süre ekledi. Seviyeyi değiştirmeden önce riskli vakaları ayrıca test edin.

04

SDK güncellemesi model ölçümünü etkiler mi?

Evet. Bizim durumumuzda eski SDK yeni modelin adını tanımadığı için düşünme ayarını hata vermeden atıyordu ve model olduğundan iki kat yavaş göründü. Ölçüm öncesi SDK'nın modeli desteklediğini ve ayarların istekte gerçekten yer aldığını doğrulayın.

Paylaş

Mustafa Gürbüz

Dolphy Yöneticisi

Dolphy'nin yöneticisi. Sesli asistan, yazılı sohbet ve bilgi tabanı hattındaki testleri yürütüyor. Yazılardaki sayılar Dolphy'nin kendi test ortamında alınan ölçümlerden geliyor; her yazı ölçümün kapsamını ve sınırını da söylüyor.

İçerik 28 Eylül 2026 tarihinde kontrol edildi

Aynı soruları müşterilere tekrar tekrar yazmayın

Dolphy web sitesi, WhatsApp ve Instagram'da işletmenizin kendi bilgisiyle yanıt verir, talepleri panele düşürür.

Demo paneli gör

İlgili yazılar

Kronometre, ortasında boşluk olan ses dalgalı telefon ve hoparlör; üstte “Bir saniye, bakıyorum işe yarıyor mu?” başlığı
Test ve Ölçüm6 dk okuma

“Bir Saniye, Bakıyorum” İşe Yarıyor mu? Sesli Asistanda Bekleme Cümlesi Testleri

Bekleme cümlesi ancak cevaptan önce duyulursa işe yarar. ElevenLabs v3 hattında yaptığımız ölçümlerde 7 kelimenin altındaki cümle seslendirilmeden bekletildi ve cevaba yapıştı; 8 kelimeden itibaren erken çaldı. Belgenin önerdiği üç nokta en yavaş sonucu verdi, virgül en hızlısıydı. Uzun cümle ise kendi süresi kadar cevabı geciktirdi. Sonunda en iyi sonucu sağlayıcının kendi kısa dolgusu, 2,5 saniye eşikle verdi.

Yazıyı oku
Grafikli laptop, ortada hassas terazi ve kontrol listesi; üstte “Chatbot'un uydurduğunu nasıl ölçtük?” başlığı
Test ve Ölçüm7 dk okuma

Chatbot'un Uydurduğunu Nasıl Ölçtük? Hakem Model, Kalibrasyon ve Gürültü

Bilgi tabanından cevap veren bir chatbot'un uydurup uydurmadığını ölçmek için gerçek cevap hattını test sorularıyla koşturan, kurallı kontrollerin yanında farklı aileden bir hakem model kullanan bir değerlendirme aracı kurduk. İlk öğrendiğimiz, hakemin de yanıldığıydı: 'kaldı' dediği 8 vakanın yalnız 2'si gerçek hataydı, 3'ü hakemin kendi yanlışıydı. Hakemi insan etiketli vakalarla kalibre ettik, sonuçları geçti/kaldı/hata diye ayırdık ve küçük setlerde ±1 vakanın gürültü olduğunu ölçtük. Bu düzenle beş işletme sitesinde 73 vakada 1 gerçek uydurma bulundu.

Yazıyı oku
Hoparlör ile mikrofon arasında telefon ve ortada buluşan iki ses dalgası; üstte “Sesli asistan ne zaman konuşmalı?” başlığı
Test ve Ölçüm7 dk okuma

Sesli Asistan Ne Zaman Konuşmalı? Türkçede Tur Sonu ve Söze Girme

Sesli asistanın en zor kararı ne zaman konuşacağı. Türkçede yüklem sonda geldiği için yarım cümleyi bitmiş saymak kolay: 'Hayır da.' gibi bir yarım söz, çerçevenin Türkçe eşiğini geçip asistanı erken konuşturdu; eşiği 0,0045'ten 0,015'e çektik. Bir görüşmede cevap 153 ms'de hazırken tur tahmini 11,7 saniye gecikti; sebep dakika başında tekrarlayan CPU çalınmasıydı ve tahmine 1,5 saniye sınır koyduk. Söze girmede asistan artık ses duyunca duraklıyor, 'evet' ve 'hı hı' gibi onay seslerinde kaldığı yerden sürüyor.

Yazıyı oku