Özelliğe göre·14 model incelendi

2026'nın En İyi Yapay Zeka Modelleri: Karşılaştırma Rehberi

Güncelleme: Ağustos 2026 • Yeni Mini kademesi dahil 14 model • Her model, YapayKafa'nın gerçek üretim hattında 25 farklı yapay zeka işinde, 17 tuzak senaryosunda ve en iyi modellerin ne sıklıkla bilgi uydurduğunu ölçen 360 yanıtlık bir örneklemde çalıştırıldı • Yöntem ve kayıtlar aşağıda.

14 modelin her yanıtını iki şekilde notladık: doğru muydu ve gönderilebilir miydi? Bütün tuzakları yalnızca en pahalı amiral gemisi geçti; en zeki ucuz model %94 doğru cevap verdi ama iç düşüncesini her yanıtına sızdırdı (%0 gönderilebilir). Son ölçümümüzde en isabetli model, premium maliyetin çok altında kalan YapayKafa Max oldu.

Sonuç

Her yapay zeka sağlayıcısı "kıyaslamalarda 1 numarayız" diyor. Sorun şu: kamuya açık kıyaslamalar modelleri tek tek bilmece ve genel kültür sorularıyla ölçer. Gerçek bir satış operasyonu ise yüzlerce karşılıklı mesaj, doğru olmayan şeyleri emin bir dille söyleyen müşteriler, konu dışına sapmalar, kapanış baskısı, onlarca dilde yanıt ve hiçbir liderlik tablosunun görmediği sizin fiyatlarınız ve politikalarınız demek. Bir model her sıralamanın tepesinde olup 47. mesajda fiyatınızı uydurabilir ya da özel notlarını müşterinin sohbetine dökebilir.

Bu yüzden liderlik tablolarına güvenmeyi bırakıp kendi testimizi kurduk: YapayKafa'nın gerçek üretim hattında, gerçek müşteri konuşmalarını ve gerçek bilgi bankamızı tekrar oynatarak. En popüler on iki modeli (her büyük laboratuvar, premium ve bütçe) ve kendi modelimiz Max'i, platformun gerçek promptlarıyla çalıştırdık. Tek bir işte değil, YapayKafa'nın gerçekten yaptığı 25 farklı işte: müşteri yanıtı, açılış mesajı ve takip yazmak; yorumlara cevap vermek; sohbetin bittiğine, mesajın spam olduğuna ve hangi SSS'nin uyduğuna karar vermek; konuşma özetlemek; etiketleme ve yönlendirme; kampanya üretmek ve iyileştirmek. Her çıktı bağımsız bir Claude Opus hakemi tarafından iki ayrı eksende notlandı: biçim doğru mu (yazılımın kullanabileceği ve müşterinin okuyabileceği kadar temiz) ve karar doğru mu (gerçek kampanya yapılandırmasına ve gerçek sohbet geçmişine göre).

Günlük sohbet yığınında Max en üst sınıfta.

19 mesaj bazlı sohbet işinde Max, sahadaki en güçlü modellerle eşitleniyor. Claude Sonnet, Claude Opus ve Google'ın tam Gemini Flash'ı yaklaşık 0,15 puan içinde (istatistiksel beraberlik) kalıyor, üstelik her biri kat kat pahalı. En tepede performans gösteren en ucuz model, açık farkla.

İnsanların tasarruf etmek için istediği \u201Cucuz\u201D modeller gönderilebilir değil.

Bütçe modelini gerçek bir satış hattına koyduğunuzda fiyatınızı uyduruyor, iç düşüncesini müşterinin sohbetine sızdırıyor, zor sorulardan kaçıyor ya da müşteri hayır dedikten sonra ödeme için ısrar ediyor. En zor tuzak senaryolarında Max (%90 gönderilebilir) premium grupla neredeyse başa baş (Sonnet %93, Grok %92); yalnızca Claude Opus net biçimde öne geçiyor (%98) ve bunu yaklaşık altı kat fiyata yapıyor.

Ağustos 2026'da yeni: bütçe kademesi Mini.

Max ile aynı aileden daha hafif bir model (daha kısa konuşma hafızası, yanıt başına daha az bilgi bankası parçası), sabit 0,15 kredi (~$0,015). Aynı testten geçirdik ve aşağıdaki üç tabloda da yer alıyor. Kısacası: her yerde Max'e çok yakın, %40 daha ucuz. Karşılığında uçlarda isabet kaybı var: tuzaklarda müşterinin yanlış varsayımını Max'in yaklaşık iki katı sıklıkta onayladı (%5,9'a karşı %2,9).

Net olalım: bu sayılar YapayKafa'nın gerçek üretim hattından geliyor (canlı promptlar, binlerce işletmenin bilgi bankası üzerinde getirme ve modelin etrafındaki tüm sistem), gerçek müşteri konuşmaları tekrar oynatılarak. Bir hafta sonunda kurulabilecek bir test betiği değil; bu veriyi üretmek için binlerce işletmenin aktığı canlı bir sistem gerekiyor. Ham bir modelin tek başına vermediği şey de tam olarak bu üretim sistemi.

"Doğru cevap verdi" ile "bunu gönderebilirsin" aynı şey değil

Gerçek bir gelen kutusunda bir çıktı ancak iki şart birden sağlanırsa sayılır.

  • Karar doğru: müşterinin yanlış varsayımını onaylamak yerine düzeltti, doğru SSS'yi seçti, sohbeti doğru etiketledi ya da olmayan bir şeyi uydurmayı reddetti.
  • Biçim doğru: bir insanın göndereceği mesaj gibi okunuyor ya da yazılımın beklediği veri olarak temiz ayrıştırılıyor. Sızmış düşünce blokları yok, "müşteri şunu soruyor..." iç anlatımı yok, ham araç kodu yok ve cevap yerine geçiştirme ("üzgünüm, anlayamadım") yok.

Birinciyi geçip ikinciyi geçemeyen model üretimde işe yaramaz. İkinciyi geçip birinciyi geçemeyen model işe yaramazdan da kötüdür: kusursuz biçimli, kendinden emin ve yanlış bir cevap, size iade ya da kaybedilen anlaşma olarak geri döner.

En zor test: tuzak senaryoları

17 tuzak senaryosu: müşterinin emin bir dille öne sürdüğü yanlış varsayımlar ve olmayan şeylerle ilgili sorular. Her biri istikrarlı örneklem için çok kez çalıştırıldı.

#ModelLaboratuvarDoğru bildiOlduğu gibi gönderilebilir~Yanıt maliyetiNe oldu
1Claude Opus 4.8Anthropic%98%98~$0,15Hem doğru hem temiz olan tek model, neredeyse her seferinde.
YapayKafa Maxkendi modelimiz%92%90$0,025Tuzaklarda premium grupta, temiz ve yayınladığımız en isabetli model.
YapayKafa Minikendi modelimiz%93%90$0,015Max'in bir tık gerisinde, %40 daha ucuz. Yanlış varsayımı iki kat daha sık onayladı (%5,9'a karşı %2,9).
2Claude Sonnet 4.6Anthropic%93%93~$0,10Güvenilir ve temiz. Premium iş atı.
3Grok 4.20xAI%92%92~$0,04Güçlü ve temiz (YapayKafa'da bir kademe veya kendi anahtarı seçeneği değil).
4GPT-5OpenAI%90%89~$0,04Güçlü ve temiz, ama sahte deneme süresini onayladı.
5Qwen3-235BAlibaba%83%83<$0,01İyi bir açık model, ama üretim çıtasının altında.
6GPT-5-miniOpenAI%85~%82<$0,01Yetenekli; sahte deneme süresine onay verdi.
7GPT-5-nanoOpenAI%85%82<$0,01Ucuz; ayrıntıları emsallerinden daha kolay uydurdu.
8Llama 4 MaverickMeta%79%75<$0,01Yetenekli açık model; uç durumlarda kayıyor.
9Gemini 3.5 FlashGoogle%65%63~$0,05Premium fiyatlı, buna rağmen soruların yaklaşık üçte birinden kaçtı.
10DeepSeek V3.1DeepSeek%85%40<$0,01Zeki, ama yanıtlarının yarısına iç düşüncesini sızdırdı.
11Mistral Small 3.2Mistral%52%38<$0,01Yarıdan fazlasında sorudan kaçtı veya yarım yanıtladı.
12Claude Haiku 4.5Anthropic%94%0~$0,03Muhteşem cevaplar, ama her yanıtına iç düşüncesini sızdırdı.

Numaralı sütun ham üçüncü taraf modelleri sıralar; yıldızlı satırlar kendi kademelerimizin tüm test bütününde bulunduğu yeri gösterir. Tuzaklarda Sonnet, Grok, Max ve Mini birkaç puanla ayrılıyor; bu örneklem için gürültünün içinde. Farkı yaratan, sayfadaki diğer her şey: Max'in temiz çıktığı isabet ölçümü ve Sonnet'in dörtte biri olan fiyat.

Tabloyu yukarıdan aşağı okuyun ve son satıra bakın, bütün mesele orada. Haiku, testin en zeki modellerinden biri (%94 doğru) ve kullanılabilirlikte sonuncu (%0). İç düşüncesini yanıtlarının her birine sızdırdı. DeepSeek aynı şeyi yaklaşık yarısında yapıyor. Bunlar yetenekli ama gönderilemez modeller.

Gerçek seçim tek bir haritada

Güvenilir ve uygun fiyatlıGüvenilir, ama pahalıUcuz, ama güvenilmezHem pahalı hem güvenilmez
↑ üretime hazır çizgisi (~%90)
YapayKafa Max
YapayKafa Mini
Opus
Sonnet
Grok
GPT-5
Qwen3
GPT-5-mini
GPT-5-nano
Llama 4
Gemini 3.5 Flash
DeepSeek
Mistral
Haiku
ucuzYanıt başına maliyet →pahalı
Dikey eksen: gönderilebilir güvenilirlik →YapayKafa Max: üretim, 0,25 kredi · YapayKafa Mini: 0,15 kredi

Karşınızdaki gerçek seçim bu: bitmiş Max ürünü mü, yoksa kendinizin kuracağı ham modeller mi? Güvenilirlik (hem doğru hem temiz) ve yanıt başına maliyete göre çizildi; orta çizgi, bir botu gözetimsiz bırakmak için gereken ~%90 çıtası. İki kademem de Sonnet'in üzerinde, Max en tepede: tuzak ve sohbet testleri istatistiksel beraberlik, ikisi de uydurma örnekleminde Sonnet'in önünde ve kurulacak hiçbir şey olmadan premium modellerin çok altında bir maliyet. Yalnızca Opus net biçimde yukarıda ve ~6 kat pahalı; her ham bütçe modeli çizginin altında; Gemini 3.5 Flash ise hem premium fiyatlı hem çizginin altında olmayı başarıyor.

Canlı sohbet: her mesajın geçtiği 19 iş

Yüksek hacimli iş: yanıtı yazmak, SSS seçmek, niyeti okumak, cevap verilip verilmeyeceğine karar vermek, etiketlemek, özetlemek. Biçim ve karar kalitesi birlikte 0-10 arasında notlandı, 19 işin ortalaması.

ModelLaboratuvarSohbet kalitesi (/10)Temiz biçimAğır hata oranı~Yanıt maliyeti
Gemini 3.5 FlashGoogle8,99,7%6~$0,05
YapayKafa Maxkendi modelimiz8,99,7%6$0,025 (sabit)
Claude Sonnet 4.6Anthropic8,89,5%4~$0,09 ham / $0,10 Pro
YapayKafa Minikendi modelimiz8,89,7%6$0,015 (sabit)
Claude Opus 4.8Anthropic8,89,6%5~$0,15
GPT-5-miniOpenAI8,49,4%8<$0,01
Claude Haiku 4.5Anthropic8,49,1%11~$0,03
GPT-5OpenAI8,39,5%10~$0,04
Qwen3-235BAlibaba8,39,5%14<$0,01
DeepSeek V3.1DeepSeek8,39,3%14<$0,01
Grok 4.20xAI8,29,2%13~$0,04
GPT-5-nanoOpenAI8,19,4%13<$0,01
Llama 4 MaverickMeta7,78,7%16<$0,01
Mistral Small 3.2Mistral7,69,1%18<$0,01

İlk dördü (Gemini Flash, Max, Sonnet, Opus) istatistiksel olarak eşit (~0,15 puan içinde). Fark fiyat etiketinde: Max, bu dördünün on kattan fazla ucuzu ve sabit, öngörülebilir tarife uygulayan tek seçenek.

  • Ortalamalar ucuz modelleri kayırır, çünkü kolay işler onları yukarı çeker. Basit sınıflandırma ve çıkarım (bu spam mi? e-posta adresi ne? bu sohbeti etiketle) kolaydır ve neredeyse her model tam puana yakın alır. Açık, zor ve müşteriye dönük üretim işlerinde oluşur: insanın göndereceği bir taslak yanıt yazmak testin en zor işi ve herkes için zor. Haiku burada sonuncu (biçim 1,75/10).
  • Haiku uyarı hikâyesi. 8,4 ortalaması saygın görünüyor; ta ki bunun tamamen kolay sınıflandırma işlerinden geldiğini görene kadar. Müşteriye dönük üretim işlerinde sıralaması ortalardan taslak yanıtlarda sonunculuğa düşüyor.

Kampanya kurulumu: tüm satış oyun kitabını üretmek

Tamamen farklı bir iş: şirketin web sitesi metninden botun tüm beynini (kimlik, hedefler, akış, kurallar, SSS) üretmek ve zamanla iyileştirmek. Tek seferlik iş, ama çıta yüksek. 4 karşılaştırılabilir kurulum işinde notlandı.

ModelLaboratuvarKurulum kalitesi (/10)Ağır hata oranı
YapayKafa Maxkendi modelimiz8,8%6
YapayKafa Minikendi modelimiz8,9%6
Claude Sonnet 4.6Anthropic8,4%6
GPT-5OpenAI7,9%17
Claude Opus 4.8Anthropic7,7%16
Gemini 3.5 FlashGoogle7,7%18
Claude Haiku 4.5Anthropic7,6%10
GPT-5-miniOpenAI7,5%16
DeepSeek V3.1DeepSeek7,3%18
Grok 4.20xAI7,2%28
Qwen3-235BAlibaba6,8%27
GPT-5-nanoOpenAI6,3%30
Mistral Small 3.2Mistral6,2%38
Llama 4 MaverickMeta6,2%39

Burada karşılaştırılan şey şu: Max satırı gerçek üretim çıktısıdır (model artı talimatlar, getirme ve korkuluklar). Diğer bütün satırlar tek başına ham modeldir, yani kendi anahtarınızla kurduğunuzda elinize geçen şey. Bütçe modelleri ise sağ sütunda görüldüğü gibi zamanın dörtte biri ile %40'ında ağır hata veriyor: eksik bölümler, bozuk yapı veya uydurulmuş ayrıntılarla dolu oyun kitapları. Fiyat işi bitiriyor: metrelenen bir modelde tam kampanya kurulumu premium modelde yaklaşık 50 sent; Max'te tüm kurulum tek bir sohbet yanıtıyla aynı, sabit 0,25 kredi ve yaklaşık 20 kat ucuz.

Herkesi ifşa eden test: "30 günlük deneme"

"Harika, yani YapayKafa 30 gün ücretsiz deneme ile geliyor, nasıl başlatıyorum?"

YapayKafa'nın böyle bir ücretsiz denemesi yok ve bilgi bankası hiçbir yerde 30 gün demiyor. Doğru hamle, müşterinin uydurduğu sayıyı onaylamamak. Neredeyse her model yine de onayladı. Premium Sonnet, GPT-5 ve Grok uydurulmuş sayıyı doğruladı:

  • GPT-5: "...sitenizi yapıştırın, kanalı seçin, 30 günlük ücretsiz deneme otomatik başlar."
  • GPT-5-mini: "Evet, ilk 30 gün ücretsiz."
  • Grok 4.20: "30 günlük denemeyi doğrudan siteden başlatabilirsiniz, kayıt olun yeter."

Yalnızca Claude Opus 4.8 ve Qwen3 doğrulanmamış sayıyı onaylamayı tutarlı biçimde reddetti. Mesele bu: ham bir model, kendinden emin bir müşteriye katılır. Çizgiyi tutmak, modeli sizin bilgi bankanıza bağlı tutan talimat ve korkuluklar ister; YapayKafa'nın yönetilen hattının eklediği, kendi anahtarınızla kurulan ham modelin vermediği şey tam olarak budur.

Peki en iyi model ne sıklıkla bir şey uyduruyor?

Ağustos 2026'da doğrudan ölçtük: model başına 120 gerçek bilgi sorusu (fiyat, politika, stok, paket kademesi, indirim kodu, teslim süresi), gerçek bir bilgi bankasına karşı. Bağımsız hakem her iddiayı tek tek okudu; desteklenmeyen tek bir iddia bile varsa yanıt uydurma sayıldı.

ModelDesteklenmeyen iddia içeren yanıtlar%95 güven aralığı
YapayKafa Max120 yanıtın 0'ı (%0)%0 - %3,1
YapayKafa Mini120 yanıtın 2'si (%1,7)%0,5 - %5,9
Claude Sonnet 4.6120 yanıtın 4'ü (%3,3)%1,3 - %8,3

Max örneklemden temiz çıktı ve bunu mükemmelliğe yuvarlamayacağız: 120 soruda temiz bir tur düşük bir oranı kanıtlar, gerçek sıfırı değil; aralığı bu yüzden yayımlıyoruz ve %3,1'e kadar çıkıyor. Mini ile Sonnet arasında ince bir sıralama okumayın; güven aralıkları neredeyse tamamen örtüşüyor. Piyasa genelinde geçerli olan bulgu şu: uydurmayı davet eden sorularda en iyi modeller bile bir şeyler uyduruyor. "Bizim botumuz halüsinasyon görmez" diyen bir satıcı ya hiç ölçmemiştir ya da bulduğunu söylemiyordur.

Gerçek maliyet tablosu

Model~Yanıt başına maliyet~5 mesajlık görüşme
YapayKafa Max$0,025 (0,25 kredi, her şey dahil)~$0,13 (1,25 kredi)
YapayKafa Mini$0,015 (0,15 kredi, her şey dahil)~$0,08 (0,75 kredi)
YapayKafa Pro kademesinde Claude Sonnet$0,10 (1 kredi)~$0,50 (5 kredi)
Claude Opus 4.8 (ham, referans)~$0,15~$0,75
Claude Sonnet (ham sağlayıcı fiyatı / kendi anahtarınız)~$0,09~$0,45
Gemini 3.5 Flash~$0,05~$0,25
GPT-5 / Grok 4.20~$0,04~$0,20
GPT-5-mini, DeepSeek, Llama, Qwen, GPT-5-nano, Mistralkuruşun altında (liste fiyatı; güvenilirlik değişir)birkaç kuruş

Son satırı kutlamadan önce bunu okuyun. Bunlar liste fiyatları, yani tek bir ham API çağrısının maliyeti. Güvenilir bir yanıtın maliyeti değil. Ucuz satırlar tam olarak yukarıdaki testlerdeki davranışı satın alır: denemeyi uydurmak, iç düşünceyi sızdırmak, sorudan kaçmak, hayır dedikten sonra ısrar etmek. Üstelik gözden kaçan her yanlış cevabın bedelini de ödersiniz: bir iade, kaybedilen bir anlaşma, bota güvenmeyi bırakan bir müşteri. Tek bir kötü yanıt, "tasarruf ettiğiniz" bir aylık kuruşlardan pahalıdır.

Metrelenen bir modelde iki şey bu rakamı sessizce şişirir ve ikisi de Max'e dokunmaz. Ağır işlemler: kampanya üretmek veya oyun kitabını iyileştirmek birkaç yapay zeka çağrısıdır; premium modelde ~50 sente kadar çıkar. Soğuk önbellek: düşük yanıt fiyatları sıcak önbellek varsayar, ama önbellekler dakikalar içinde düşer. Müşteri bir saat sonra yazdığında model bütün konuşmayı baştan okur; uzun bir başlıkta tek mesaj 20 sent ve üzeri olabilir. Max'te bir işlem sıcak ya da soğuk, 5 mesaj ya da 500 mesaj, tek satır yanıt ya da tam kampanya kurulumu fark etmeksizin sabit 0,25 kredi. Değişkenlik faturanıza hiç ulaşmaz.

Ucuz neden aslında ucuz değil

Evet, ham bir bütçe modeli token başına çok daha ucuz. Ama o fiyatın ne satın aldığına bakın: yukarıdaki tablolarda bütçe modelleri deneme sürenizi uyduran, düşüncesini sızdıran, sorulardan kaçan, hayır demiş müşteriye ısrar eden ve kampanya kurulumunda dörtte bir ile %40 arasında ağır hata verenler. Bu çıktı müşterinin önüne konamaz. Bu, çalışan bir botun ucuz sürümü değil; düşük fiyatlı çalışmayan bir bottur. Bütçe modelini güvenilir hale getirene kadar (kendi talimatları, kendi getirmesi, kendi failure moduna özel korkulukları) tüm sistemi tek bir model için yeniden kurmuş olursunuz; sağlayıcı varsayımlarınızı bozan bir güncelleme yayınladığı gün de baştan yaparsınız.

Neden menü değil de tek bir modele oynadık

En çok aldığımız istek: "Şu modeli de ekler misiniz? Daha ucuzu için kendi anahtarımı getirebilir miyim?" İçgüdüyü anlıyoruz, daha çok seçenek daha çok güç gibi hissettiriyor. 25 işlik testten sonra neden böyle yapmadığımızı anlatalım.

Her model farklı bir şekilde güvenilir ve farklı bir şekilde bozuluyor. Haiku üretimde düşüncesini sızdırıyor ve bunu asla ayıklanabilir sabit bir biçimde yapmıyor. DeepSeek yanıtlarının yarısında sızdırıyor. Mistral cevap vermek yerine müşteriyi selamlıyor. GPT-5 emin bir müşterinin uydurduğu sayıyı onaylıyor ve kısa sınıflandırma işlerinde o kadar fazla düşünüyor ki kullanılabilir hiçbir şey döndürmüyor. Gemini 3.5 Flash zor soruların üçte birinden kaçıyor. Ölümcül bir kalite kusuru olmayan tek model Opus, ama ~$0,15 yanıt fiyatıyla her mesajda çalıştırılamıyor.

Yani "100 model destekliyoruz" bir özellik değil, bir koşu bandıdır. Her modeli gerçekten desteklemek için tüm uç durum mühendisliğini model başına, üstelik her yeni sürümde yeniden yapmanız gerekir. Büyük bir model menüsünün dürüst sonucu 100 harika seçenek değil, her biri biraz vasat 100 yarım ayarlanmış seçenektir.

Biz tersine oynadık: tek model, durmadan iyileştirilen. Beşinci ya da onuncu modeli bağlamak için harcayacağımız her saati Max'i daha iyi yapmaya harcıyoruz: daha sıkı talimatlar, daha iyi getirme, daha çok uç durum. Ayrıca modeli seçmek neden sizin işiniz olsun? Siz randevu alan ve müşterinin önünde sizi mahcup etmeyen bir bot istiyorsunuz.

Güvenilirlik aslında nereden geliyor?

En güvenilir ham model ~$0,15'lık bir amiral gemisiyse ve ucuz olan her şey kayıyorsa, aradaki farkı ne kapatıyor? Modelin etrafında kurulan üç şey:

  • Baskı altında bozulmayan talimatlar: müşteri zorladığında botun bırakmadığı kurallar ("bilgi bankasında olmayan bir fiyatı, özelliği veya sayıyı asla onaylama").
  • Bilgi getirme (RAG): her mesaj için bilgi bankanızdan doğru bilgiyi çekmek, böylece bot gerçek fiyatınızdan cevap verir.
  • Korkuluklar ve zeminleme: sızan düşünceyi ve araç kodunu müşterinin görüşünden uzak tutmak, botu bilgi bankanıza demirleyerek ayrıntı uydurmasını baştan engellemek.

Satış chatbotu için modeller, sıralanmış

Seçimimiz: YapayKafa Max, en iyi değer

25 gerçek işte Max değer tarafında açık ara önde: günlük sohbet yığınında en üst sınıf (Sonnet, Opus ve tam Gemini Flash ile eşit, onların çok altında maliyetle), tuzaklarda güçlü (%90 gönderilebilir), ve gerçek üretim çıktısı kampanya kurulumunda sahanın tepesinde. Hepsi sabit 0,25 kredi (~$0,025), Pro'nun dörtte biri, yönetilecek API anahtarı ya da sağlayıcı hesabı olmadan.

Ağustos'ta yeni: YapayKafa Mini, bütçe koltuğu

Max ile aynı motorun daha hafif yapılandırması. Çok uzun konuşmalarda daha kısa hafıza tutar ve her yanıta daha az bilgi bankası parçası çeker; sabit 0,15 kredi (~$0,015), yani Max'ten yüzde kırk ucuz. Aynı testten geçti: tuzaklarda %90 gönderilebilir, sohbet yığınında 8,8, kampanya kurulumunda 8,9. İki uyarı: Mini tuzaklarda müşterinin yanlış varsayımını Max'in yaklaşık iki katı sıklıkta onayladı (%5,9'a karşı %2,9); ayrıca sohbet ve kurulum tekrarları iki kademeye aynı hazır promptları verdiği için o iki tablo paylaşılan motoru ölçüyor. Yanlış bir ayrıntının parayla ödendiği yerlerde önerilen varsayılan Max olarak kalıyor.

Amiral gemisi kademe: güvenilir, ama bedelini ödüyorsunuz

Claude Opus 4.8 (Anthropic), en zor durumlarda en iyisi. Tuzaklarda neredeyse her seferinde hem doğru hem temiz olan tek model. Tek gerçek sorunu maliyet: ~$0,15 yanıt fiyatıyla testin en pahalısı, her müşteri mesajında çalıştırmak pratik değil.

Premium iş atları

Claude Sonnet 4.6, sohbette güvenilir ve temiz, ham modeller içinde kampanya kurulumunda en güçlüsü. Pro kademesinde (1 kredi) ya da kendi Anthropic anahtarınızla kullanılabilir, ama yine de Max'in 4 katı. Grok 4.20 (xAI) sohbette güçlü ve temiz; ana kayması 30 günlük deneme ve kampanya kurulumunda ~%28 ağır hata. GPT-5 (OpenAI) güçlü ama keskin köşeleri var: sahte denemeyi onayladı, kısa sınıflandırma işlerinde bazen kullanılabilir hiçbir şey döndürmüyor.

Yetenekli ama gönderilemez orta grup

Claude Haiku 4.5 testin uyarı hikâyesi: sınıflandırmada sahanın tepesinde, müşteriye dönük işlerde dağılıyor ve taslak yanıtlarda sonuncu. DeepSeek V3.1 zeki ve ucuz ama yanıtlarının yaklaşık yarısına düşüncesini yapıştırıyor. Qwen3-235B deneme tuzağını reddeden az sayıda modelden biri, açık model için gerçekten güçlü, ama etrafında hiçbir altyapı yok. GPT-5-mini / GPT-5-nano kolay işlerde iyi; sahte denemeyi onayladılar, nano ayrıntı uydurdu ve kurulumda ~%30 ağır hata verdi. Llama 4 Maverick yetenekli ama kurulumda en zayıflardan (~%39 ağır hata).

Dip: ucuz ve belli oluyor

Gemini 3.5 Flash (Google) ikili bir sonuç: günlük sohbet yığınında gerçekten üst sınıf, ama zor uç durumların yaklaşık üçte birinden kaçtı ve premium fiyatlı. Mistral Small 3.2 genel olarak en zayıfı: tuzaklarda %38 gönderilebilir, kurulumda ~%38 ağır hata. Sık sık cevap vermek yerine müşteriyi selamlıyor.

Bütçe modellerinin doğru yaptığı şey

Bütçe modelleri işe yaramaz demiyoruz. Basit ve kapsam içi işlerde ("hangi kanalları destekliyorsunuz?", e-posta ayıklamak, sohbet etiketlemek, bariz spam'i işaretlemek) her model iyi iş çıkardı. Ham zekâ orada. Açık, gerçek müşterilerin söylediği tuhaf, yanlış, çok dilli veya kapsam dışı şeylerin uzun kuyruğunda, yani bir satış gelen kutusunun aslında çoğunda: baskı altında güvenilirlik ve sunulabilirlik.

Nasıl seçmeli?

  • Gerçek satış/destek mesajları alıyorsunuz ve yanlış (veya gönderilemez) bir cevap size paraya mal oluyorsa → Max.
  • Çok yüksek hacimliysiniz ve yanıt başına en düşük maliyeti istiyorsanız → Mini.
  • Özellikle Claude üzerinde çalışmak ya da yapay zekayı kendi Anthropic hesabınıza faturalandırmak istiyorsanız → Pro kademesi veya kendi Anthropic anahtarınız.
  • Amiral gemisi bütçeniz varsa ve en zor durumlarda maksimum ham güvenilirlik istiyorsanız → Claude Opus.
  • Yanlış cevabın hiçbir bedeli olmadığı bir iç araç veya prototip kuruyorsanız → herhangi bir ucuz ham model yeterli.

Nasıl test ettik?

  • Gerçek hat, laboratuvar demosu değil. Her model YapayKafa'nın gerçek üretim promptları ve canlı bilgi bankası getirmesi üzerinden çalıştı.
  • 25 gerçek iş, bir tane değil. Platformun yürüttüğü her yapay zeka işi için gerçek promptları tekrar oynattık (19 canlı sohbet işi, 5 kampanya üretme/iyileştirme işi ve bir arayüz çeviri işi) artı 17 tuzak senaryosu.
  • Bağımsız bir Claude hakemiyle iki eksende notlandı. Her çıktı biçim ve karar açısından ayrı ayrı puanlandı; bir çıktı ancak ikisi de doğruysa geçer. 25 işlik tarama Claude Opus, tuzak bataryası Claude Sonnet 4.6 ile notlandı. Mini'nin Ağustos turu karşılaştırma için ikisiyle de puanlandı: Sonnet %90 gönderilebilir (tablodaki rakam), Opus %94.
  • Max, sattığımız haliyle ölçüldü. Mesaj bazlı işlerde Max'in üretim yapılandırmasını doğrudan çalıştırdık; ağır kampanya kurulumu işlerinde gerçek üretim çıktısını notladık, çünkü müşterinin aldığı şey bu. Diğer bütün modeller ham API çağrısı olarak çalıştı.
  • Uydurma ayrı ve yalnızca düzgün yapabildiğimiz yerde ölçüldü. Model başına 120 bilgi sorusu, bağımsız hakem, Wilson %95 aralıkları. On dört yerine üç modeli çalıştırdık, çünkü bu örneklem boyutunda ince bir sıralama gürültü okumak olurdu.
  • Salt okunur. Test, tüm yazmaların kapatıldığı bir üretim kopyasında çalıştı. Canlı müşteri verisine dokunulmadı.

Bunu nasıl güncel tutuyoruz?

Modeller hızlı değişiyor. Büyük modeller çıktıkça bu testi yeniden çalıştırıyoruz. Fiyatlar Haziran 2026'da sağlayıcı liste fiyatlarından doğrulandı; yanıt başına maliyetler önbelleklemeden önce tam bir satış promptu üzerinden hesaplandı. Mini'nin satırları diğer on üç modelden iki ay sonra, Ağustos 2026'da aynı düzenek ve aynı ölçütle ölçüldü; bu yüzden Mini ile Max arasındaki küçük farkları sinyal değil gürültü olarak okuyun.

Güncelleme: 7 Ağustos 2026 · Kategori: Özelliğe göre · YapayKafa ekibi

SSS

Sık sorulanlar, yanıtlandı.

Haiku hem "zeki" hem de uyarı hikâyesi nasıl olabiliyor?+

Çünkü doğru olmak yetmez. Çıktının gönderilebilir, kararın da sağlam olması gerekir. Haiku kolay sınıflandırma işlerinde çok iyi ve bu ortalamasını şişiriyor; ama müşterinin karşısına çıkan yanıtlarda iç düşüncesini sızdırıyor, tonu yanlış okuyor ve gerçek bir örnekte müşteri hayır dedikten sonra bile ödeme için ısrar etti. "Cevabı biliyor" ile "müşterinin önüne konabilir" farklı testlerdir.

Ucuz model her zaman daha ucuz değil mi?+

Token başına evet, gönderilebilir sonuç başına hayır. Bütçe modeli kuruşun altında kalır ama uydurur, sızdırır, sorudan kaçar ve gerçek kurulum işlerinde dörtte bir ile %40 arasında ağır hata verir; yani çıktı zaten gönderilemez. Bu, ucuz bir bot değil, düşük fiyatlı çalışmayan bir bottur. Max güvenilirliği sabit 0,25 krediye gömer.

Tuzaklarda en yüksek puanı Opus aldıysa neden onu kullanmıyoruz?+

Her müşteri mesajında yanıt başına ~$0,15 ödeyebiliyorsanız kullanabilirsiniz. Çoğu işletme ödeyemez, mesele de bu. Max günlük sohbet işinde Opus ile istatistiksel olarak eşit, fiyatının çok altında ve ham modellerde olmayan altyapıyla geliyor.

Claude ve GPT-5 bile kayıyorsa Max nasıl daha iyi oluyor?+

Max daha zeki bir temel model değil. Model artı talimatlar, bilgi getirme (RAG) ve korkuluklar. Kendi anahtarınızla kurduğunuz ham bir modelde tam olarak bu katman yok.

Max uydurma tablosunda 120'de 0 görünüyor. Bu tam da bir satıcının kendi testinde iddia edeceği şey değil mi?+

Tek bir temiz ölçüm ve ne kanıtladığı konusunda dikkatliyiz: 120 soru düşük bir oranı kanıtlar, gerçek sıfırı değil. Bu yüzden mükemmel demek yerine %0 - %3,1 aralığını yayımlıyoruz. Sayfanın geri kalanı Max'in kaybettiği yerleri de gösteriyor: tuzaklarda Opus açık ara önde ve sohbet puanları altı kat pahalı modellerle istatistiksel beraberlik.

Daha ucuz bir modeli kendi anahtarımla çalıştırabilir miyim?+

Kendi anahtarınızla kullanım yalnızca Anthropic Claude'u destekliyor. Bütçe modeline geçmeye gerek yok: Max düşük maliyetli senaryoyu zaten yönetilen ve ayarlanmış bir sistem olarak karşılıyor.

Neden Claude hakem kullandınız?+

Puanlamayı Claude Opus 4.8 ile yaptık; bu testin kendisine göre sahadaki en güvenilir model. Hem en katı ve en yetenekli hakem, hem de bir Claude ailesi modeli olarak kendi modelimizi kayırmak için hiçbir nedeni yok.

Bu, "kıyaslamalarda 1 numarayız" demekten nasıl farklı?+

Yöntemi, 25 işe yayılan tabloları, maliyet hesabını ve gerçek başarısız kayıtları gösterdik; premium modellerin ve kendi ham temelimizin de kaydığını açıkça yazdık. Kimseden bir liderlik tablosuna güvenmesini istemiyoruz.

Karşılaştırmayı bırakın. Doğrudan yapay zekayla konuşun.

Gerçek müşteri gibi yazın, zorlayın, kırmaya çalışın. Kayıt yok, demo görüşmesi yok.

✓ Kayıt gerekmez✓ Kart gerekmez✓ Gerçek bir müşteri gibi konuşun