Ajan kanalını ölçmek: Tek bir ekran görüntüsü neden yanıltır?
Aynı soruyu yüz kez soran bir araştırmada yapay zekâ asistanları neredeyse hiç aynı listeyi vermedi. Ajan kanalında doğru ölçüm sıralamayla değil; gerçek alıcı görevleri, tekrar ve güven aralığıyla yapılır.
Bir pazarlama yöneticisi ChatGPT'ye "en iyi espresso makinesi markaları hangileri?" diye soruyor; markası listede yok. Ekran görüntüsü toplantıya taşınıyor. Ertesi gün bir ekip arkadaşı aynı soruyu soruyor; marka bu kez üçüncü sırada. Hangisi doğru?
Cevap: ikisi de tek başına bir şey söylemiyor. Bu yazıda yapay zekâ asistanlarının yanıtlarının neden değişken olduğunu, bu değişkenlik içinde neyin güvenilir biçimde ölçülebileceğini ve bir düzeltmenin gerçekten işe yarayıp yaramadığını nasıl anlayacağınızı anlatıyoruz.
Aynı soru, her seferinde farklı liste
SparkToro'dan Rand Fishkin ve Gumshoe'dan Patrick O'Donnell, Ocak 2026'da yayımladıkları araştırmada bu soruyu sistemli biçimde sınadı. 600 gönüllü, Kasım ve Aralık 2025 boyunca 12 farklı öneri sorusunu ChatGPT, Claude ve Google'ın yapay zekâ yanıtlarında toplam 2.961 kez çalıştırdı. Sorular şef bıçağından kulaklığa, hastaneden dijital pazarlama danışmanlarına kadar farklı kategorilerdeydi.
Sonuçlar net:
- ChatGPT ya da Google'ın yapay zekâsına aynı soru yüz kez sorulduğunda iki yanıtın aynı marka listesini vermesi ihtimali yüzde birin altında.
- İki listenin aynı sırada gelmesi ise yaklaşık binde bir ihtimal.
- Buna karşılık bazı markaların yanıtlarda ne sıklıkla göründüğü çok daha tutarlı. Ailece seyahat için kulaklık sorusunda öne çıkan markalar yanıtların yüzde 90-100'ünde yer alıyor.
Araştırmacıların vardığı sonuç, ajan kanalını ölçen herkes için temel kural: yapay zekâda "sıralama pozisyonu" anlamlı bir ölçü değil; bir markanın çok sayıda yanıt içinde görünme oranı ise anlamlı.
Değişkenlik nereden geliyor?
- Olasılıksal üretim. Dil modelleri her yanıtı olasılıklara göre üretir; aynı soru, aynı modelde bile farklı bir yanıt doğurabilir.
- Değişen kaynaklar. Web'de arama yapan asistanlar her seferinde farklı sayfalar bulup farklı kaynaklara dayanabilir.
- Model güncellemeleri. Modeller ve arama altyapıları sık güncellenir. Geçen ayın ölçümü bugünkü modeli temsil etmeyebilir.
- Bağlam. Dil, konum, sorunun ifadesi ve kullanıcının önceki konuşmaları sonucu etkiler.
Bu yüzden tek bir yanıt, ister iyi ister kötü olsun, bir anekdottur. Ölçüm ancak çok sayıda yanıtın dağılımına bakınca başlar.
Ölçülmesi gereken şey: seçilme oranı
Ajan ticaretinde asıl soru "anıldık mı?" değil, "kısa listeye girdik mi?" sorusudur. Bu yüzden ölçtüğümüz şey seçilme oranı: belirli bir alıcı görevi için, yanıtların yüzde kaçında markanızın önerilen kısa listede yer aldığı.
Ama oran tek başına yetmez; kaç yanıta dayandığı da önemlidir. Bir örnek:
- 20 yanıtın 6'sında seçildiniz: oran %30. Ama %95 güven aralığı (Wilson) yaklaşık %15 ile %52 arasında. Yani gerçek oran "nadiren" de olabilir, "her iki yanıttan birinde" de.
- 80 yanıtın 24'ünde seçildiniz: oran yine %30, ama aralık %21 ile %41 arasına daralıyor.
Aynı oran, farklı örneklem büyüklüklerinde çok farklı bir kesinlik taşır. Güven aralığı olmadan raporlanan bir yapay zekâ görünürlük skoru, ne kadar güvenilir olduğunu söylemeyen bir skordur.
İyi bir ölçüm düzeninin altı kuralı
- Anahtar kelime değil, alıcı görevi. "Espresso makinesi" bir arama terimidir. "15.000 TL altı, iki günde teslim edilen, 30 gün iadeli bir espresso makinesi bul" ise bir alıcı görevidir. Ajanlar kısıtlara göre eler; mağazanızın nerede elendiğini ancak kısıtlı görevler gösterir.
- Tekrar. Her görev, her yüzeyde ve her dilde tek bir kez değil, defalarca çalıştırılmalı. Biz bir hücre için 20 yanıtın altını "yetersiz örnek" sayıyoruz.
- Güven aralığı. Her oran, aralığıyla birlikte raporlanmalı. Aralığı geniş bir sonuçla karar verilmez.
- Yüzeyleri ve dilleri ayrı tutun. ChatGPT, Gemini, Claude ve Perplexity farklı kaynaklara ve farklı modellere dayanır. Türkçe ve İngilizce sorular da farklı sonuç verir. Hepsini tek bir "yapay zekâ skoru"nda birleştirmek, düzeltilmesi gereken yeri gizler.
- Sürüm değişikliklerini işaretleyin. Model, soru şablonu ya da değerlendirme yöntemi değiştiğinde ölçüm serisine bir kırılma çizgisi koyun; çizginin iki yanını birbiriyle karşılaştırmayın.
- Nedeni kaydedin. "Listede miyiz?" sorusunun yanında rakibin hangi gerekçeyle seçildiğini ve yanıtta hangi kaynakların gösterildiğini de kaydedin. Düzeltme listesi buradan çıkar.
Web analitiği neyi gösterir, neyi göstermez?
OpenAI'ın yayıncılar için yaptığı açıklamaya göre ChatGPT, arama sonuçlarından verdiği bağlantılara otomatik olarak utm_source=chatgpt.com parametresini ekliyor. Böylece ChatGPT'den gelen ziyaretler analitik araçlarında ayrı bir kaynak olarak görülebiliyor. Sunucu günlüklerinizde de OpenAI'ın arama tarayıcısı OAI-SearchBot'un ve kullanıcı adına sayfa açan ChatGPT-User'ın isteklerini izleyebilirsiniz.
Bunlar değerli sinyaller, ama yalnızca görünen tarafı ölçer: önerildiğiniz ve tıklandığınız konuşmaları. Listeye girmediğiniz konuşmalar analitikte hiç iz bırakmaz; ne ziyaret vardır ne de hemen çıkma. Seçilme oranı tam olarak bu görünmeyen tarafı ölçer. İkisi birlikte tam resmi verir: biri kanalın ne kadar trafik getirdiğini, diğeri ne kadarını kaçırdığınızı gösterir.
Bir düzeltmenin işe yaradığını nasıl anlarsınız?
Ürün verisini düzelttiniz, iade politikasını yeniden yazdınız. Etkisini görmek için:
- Önce ölçün. Düzeltmeden önce aynı görevlerde en az birkaç haftalık bir taban oluşturun.
- Tarihi kaydedin. Değişikliğin yayına girdiği günü not edin. Arama altyapılarının yeni içeriği görmesi zaman alabilir; ilk haftayı karşılaştırmaya katmayın.
- Aynı koşullarda tekrarlayın. Aynı görevler, aynı yüzeyler, aynı diller, aynı soru şablonu.
- İstatistik testi uygulayın. İki dönemin oranlarını iki oran testiyle karşılaştırın.
Testin neden gerekli olduğunu bir örnek gösteriyor. Oranınız 20 yanıtta %30'dan %45'e çıktı: 15 puanlık artış iyi görünüyor, ama gerçekte hiçbir değişim olmasa bile bu büyüklükte bir farkın rastlantıyla ortaya çıkma ihtimali yaklaşık üçte bir (p ≈ 0,33). Yani "değişim yok" demek gerekir. Oran 80'er yanıtta %20'den %40'a çıktıysa aynı ihtimal binde altı civarına (p ≈ 0,006) düşer; bu, rastlantıyla açıklanamayacak bir iyileşmedir.
Dokunmadığınız görevleri de izlemeye devam edin. Onlar da aynı dönemde yükseldiyse değişimin nedeni sizin düzeltmeniz değil, modelin kendisi olabilir.
Sonuç
Ajan kanalında bir ekran görüntüsü anekdottur; ölçüm ise bir dağılımdır. Doğru ölçüm gerçek alıcı görevleriyle başlar, her hücreyi yeterince tekrarlar, her oranı güven aralığıyla verir ve bir düzeltmenin etkisini testle doğrular. Bu disiplin olmadan "yapay zekâda görünürlüğümüz arttı" cümlesi bir umuttan ibarettir.
Specoria tam olarak bu yöntemle çalışır: mağazanızı gerçek alıcı görevleriyle dört yüzeyde ve birden fazla dilde ölçer, elendiğiniz noktaları kaynağına kadar izler ve düzeltmenin etkisini aynı görevlerle yeniden ölçer. Mağazanızın bugünkü seçilme oranını görmek için ücretsiz ön rapor isteyebilirsiniz.
Kaynaklar
- SparkToro, NEW Research: AIs are highly inconsistent when recommending brands or products; marketers should take care when tracking AI visibility, Rand Fishkin ve Patrick O'Donnell, 28 Ocak 2026.
- Search Engine Journal, AI Recommendations Change With Nearly Every Query: SparkToro, 30 Ocak 2026.
- OpenAI Yardım Merkezi, Publishers and developers FAQ.
- OpenAI, Overview of OpenAI Crawlers.
- E. B. Wilson, Probable Inference, the Law of Succession, and Statistical Inference, Journal of the American Statistical Association, 22(158), 1927.