20 Soruluk Testle Doğru Kurumsal Yapay Zekâ Modelini Seçin
Özel belgelerinizi bağlamadan veya daha büyük bir modele geçmeden önce gerçek iş sorularıyla basit bir değerlendirme seti oluşturun.
Bir yapay zekâ modelini itibarı, fiyatı veya etkileyici demosu üzerinden seçmek, işe pahalı bir şekilde başlamaktır. Harika pazarlama metinleri yazan bir model; iade politikanız, ürün kataloğunuz veya şirket içi süreçleriniz hakkında yine de güvenilmez yanıtlar verebilir.
Bu hafta daha pratik bir karar verebilirsiniz: Gerçek iş sorularından küçük bir değerlendirme seti oluşturun, ardından modelleri ve bilgiye erişim yöntemlerini bu setle karşılaştırın. Büyük bir veri setine veya altı aylık bir yapay zekâ projesine ihtiyacınız yok. Temsil gücü yüksek sorulara, net başarı kriterlerine ve kontrollü bir teste ihtiyacınız var.
Gerçek 20 soruyla başlayın
Ekibinizin, müşterilerinizin veya satış potansiyellerinizin gerçekten sorduğu sorulardan bir liste oluşturun. Yapay zekâyı iyi göstermek için hazırlanmış sorulardan kaçının. Karmaşık, eksik ve yanıtlaması zor sorulara da mutlaka yer verin.
Örneğin bir e-ticaret işletmesi şu soruları toplayabilir:
- “Üç hafta önce indirimli aldığım ürünü iade edebilir miyim?”
- “Evcil hayvanım varsa temizlemesi en kolay koltuk kumaşı hangisi?”
- “Bu ürün Dubai mağazasında mevcut mu?”
- “Belirli bir tutarın üzerindeki siparişler için teslimat kurallarını özetler misin?”
- “Yedek parçaya ihtiyacım var ancak ürün kodunu bilmiyorum.”
Ana kullanım alanınızı kapsayacak şekilde 20 ila 30 soru hedefleyin. Şirket içi bir asistan geliştiriyorsanız çalışanlardan e-posta, WhatsApp, destek talepleri veya ortak kullanılan belgelerde sık karşılaştıkları soruları isteyin. Müşteriye açık bir asistan geliştiriyorsanız konuşmalardan ve arama verilerinden anonimleştirilmiş sorular kullanın.
Her soruyu türüne göre etiketleyin:
- Bilinen bilgi: Yanıt doğrudan bir belgede veya veri tabanında bulunmalıdır.
- Birden fazla adım gerektiren: Asistan birden fazla kaynaktaki bilgiyi birleştirmelidir.
- Belirsiz: Asistan açıklayıcı bir soru sormalıdır.
- Kapsam dışı: Asistan yardımcı olamayacağını açıkça belirtmelidir.
- Hassas: Asistan özel veya erişimi kısıtlı bilgileri paylaşmamalıdır.
Bu sınıflandırma önemlidir çünkü iyi bir sistem her soruyu yanıtlayan sistem değildir. Doğru soruları yanıtlayan, gerektiğinde açıklama isteyen ve bilgi eksik olduğunda güvenli şekilde geri çekilen sistemdir.
Testten önce “iyi yanıtın” ne olduğunu tanımlayın
Modelleri “Model A daha akıllı hissettiriyor” gibi genel bir izlenimle karşılaştırmayın. Her soru için ihtiyacınız olan davranışı önceden yazılı hâle getirin.
Her test için şu bilgileri kaydedin:
- Beklenen yanıt veya kaynak: Asistan ne söylemeli ya da yanıtı hangi belge desteklemeli?
- Mutlaka bulunması gereken ayrıntılar: Örneğin iade süresi, doldurulması gereken form veya teslimat kısıtlaması.
- Kesinlikle yapılmaması gerekenler: Örneğin var olmayan bir indirim uydurmak, şirket içi kâr marjını açıklamak veya teslimat tarihi taahhüt etmek.
- Kabul edilebilir alternatif yanıt: Bilgi mevcut değilse asistan ne söylemeli?
- İnsana yönlendirme kuralı: Soru hangi durumda bir çalışan ya da uzmana aktarılmalı?
İlk tur için basit bir puanlama sistemi yeterlidir. Her yanıta 0 ile 2 arasında puan verin:
- 0: Yanlış, riskli veya kendinden emin biçimde uydurulmuş.
- 1: Kısmen faydalı ancak önemli bir ayrıntı eksik ya da düzeltme gerektiriyor.
- 2: Doğru, uygun kaynakla desteklenmiş ve istenen üslupla yazılmış.
Yanıt süresini ve soru başına yaklaşık maliyeti de takip edebilirsiniz. Bunlar evrensel hedefler değil, örnek ölçümlerdir. Müşteriye açık bir asistan hızlı yanıt vermek zorunda olabilirken şirket içi bir araştırma aracı, yanıt daha güvenilir olduğu sürece daha yavaş çalışabilir.
Yalnızca üç modeli değil, üç farklı kurulumu test edin
Şirketler çoğu zaman sistemin geri kalanını göz ardı ederek yalnızca model seçimine odaklanır. Oysa aynı model; talimatlara, belge erişimine ve çıktı kontrollerine bağlı olarak çok farklı performans gösterebilir.
20 sorunuzun tamamını şu üç temel kurulumda çalıştırın:
1. Yalnızca model ile başlangıç testi
Modele talimatlarınızı verin ancak özel şirket belgelerini bağlamayın. Bu test, modelin zaten ne bildiğini ve hangi noktalarda tahmin yürütmeye meyilli olduğunu gösterir.
Özel verilere ihtiyaç duyacağınızı bilseniz bile başlangıç testi faydalıdır. Hangi sorular için gerçekten bilgi erişimi gerektiğini görmenizi sağlar ve sonraki iyileştirmeler için bir karşılaştırma noktası oluşturur.
2. Küçük ve temiz bir belge setiyle RAG
Seçtiğiniz kullanım alanı için yalnızca gerekli belgeleri bağlayın. Bunlar güncel iade politikası, teslimat rehberi, ürün bilgileri ve yönlendirme prosedüründen oluşabilir.
RAG veya arama destekli üretim, sistemin özel verilerinizdeki ilgili bölümleri bulmasına ve yanıt oluştururken kullanmasına imkân tanır. Ancak zayıf belgeleri otomatik olarak güvenilir hâle getirmez. İki dosyada farklı iade süreleri yer alıyorsa, hangi kaynağın güncel olduğunu belirlemediğiniz sürece asistan yine çelişkili bir yanıt üretebilir.
Teste başlamadan önce tekrarları kaldırın, eski sürümleri arşivleyin ve belgelere anlaşılır başlıklar ile tarihler ekleyin. İyi yönetilen küçük bir bilgi tabanı, şirketin bugüne kadar ürettiği her belgenin bulunduğu büyük bir klasöre göre genellikle daha kolay test edilir.
3. Talimatlar ve güvenlik kurallarıyla RAG
Kaynak kullanımı, belirsizlik ve yönlendirme için kurallar ekleyin. Örneğin:
- Politika sorularını yalnızca onaylanmış belgeleri kullanarak yanıtla.
- Bulunan içerik yanıtı desteklemiyorsa bunu açıkça belirt.
- Fiyat, stok durumu, teslimat taahhüdü veya iade kararı uydurma.
- Sipariş numarasını yalnızca onaylanmış ve güvenli bir iş akışı üzerinden iste.
- Şikâyetleri, hukuki soruları ve istisnai durumları bir çalışana yönlendir.
Üçüncü test, “model yanıtı biliyor” ile “şirket bu sistemi güvenle kullanabilir” arasındaki farkı ortaya koyar.
Sonuçları pratik bir karara dönüştürün
En yüksek ortalama puanı alan kurulumu seçmek yerine hataları kategorilerine göre inceleyin. Tek bir tehlikeli halüsinasyon, birkaç küçük üslup probleminden daha önemli olabilir.
Yalnızca modelle yapılan başlangıç testi genel sorularda başarılı, ancak politika ayrıntılarında başarısızsa bir bilgi erişim katmanına ihtiyacınız olabilir. RAG ilgisiz veya çelişkili bölümler getiriyorsa model değiştirmeden önce belgeleri ve arama ayarlarını iyileştirin. Yanıtlar doğru ancak sistem yavaş veya pahalıysa basit sorular için daha küçük bir model, karmaşık durumlar için daha güçlü bir model test edin.
Pratik bir yönlendirme politikası şöyle olabilir:
- Sınıflandırma, biçimlendirme ve basit bilgi sorguları için daha düşük maliyetli bir model kullanın.
- Birden fazla belgeyi ilgilendiren sorular veya nüanslı metin üretimi için daha güçlü bir model kullanın.
- Özel bilgileri içeren sorularda bilgi erişimini zorunlu tutun.
- Güven düzeyi düşük, hassas veya yüksek etkili talepleri bir çalışana aktarın.
Örneğin bir mağaza haftada 300 müşteri sorusu alıyorsa, çalışma saatleriyle ilgili soruları daha hafif bir akıştan geçirirken ürün uyumluluğu sorularını RAG destekli bir iş akışına yönlendirebilir. Sayılar ve yönlendirme kuralları işletmenize göre değişir; temel yaklaşım, maliyeti ve yeteneği görevin gerektirdiği seviyede eşleştirmektir.
Bir haftalık uygulama kontrol listesi
1. gün: Soruları toplayın
20 ila 30 gerçek ve anonimleştirilmiş soru toplayın, ardından türlerine göre etiketleyin. En az birkaç kapsam dışı ve belirsiz soruya da yer verin.
2. gün: Kaynakları hazırlayın
Yanıtları desteklemesi gereken belgeleri seçin. Eski sürümleri kaldırın ve her kaynağın güncel tutulmasından sorumlu kişiyi belirleyin.
3. gün: Kabul kurallarını yazın
Doğru yanıtları, yasak davranışları, alternatif yanıt dilini ve yönlendirme koşullarını tanımlayın. Kurallar, başka bir kişinin de aynı şekilde uygulayabileceği kadar açık ve somut olsun.
4. gün: Karşılaştırmayı çalıştırın
Yalnızca model, RAG ve güvenlik kuralları eklenmiş RAG kurulumlarını test edin. Yanıtları, kullanılan kaynakları, hataları, yanıt süresini ve tahmini maliyeti kaydedin.
5. gün: İlk üretim kapsamına karar verin
Sınırları net olan tek bir iş akışı seçin. Kullanılacak modeli, kaynakları, güvenlik kurallarını ve insan desteğine geçiş koşullarını belgeleyin. Değerlendirme setini, gelecekteki her değişiklik için regresyon testi olarak saklayın.
ADMOV nasıl yardımcı olabilir?
ADMOV, işletmelerin genel chatbot demoları yerine gerçek iş akışlarına göre LLM sistemleri kurmasına ve entegre etmesine yardımcı olur. İş sorularınızı bir değerlendirme setine dönüştürmenize, özel belgelerinizi temizleyip RAG yapısına bağlamanıza, güvenlik kuralları ve yönlendirme adımları belirlemenize, model seçeneklerini güvenilirlik ve maliyet gereksinimlerinize göre karşılaştırmanıza destek olabiliriz.
Aynı test setini belgeleriniz, komutlarınız veya modelleriniz değiştikçe devam eden bir kalite kontrolü olarak da kullanabilirsiniz. Değerlendirmek istediğiniz ilk iş akışını görüşmek için https://admov.io/#contact adresinden ücretsiz bir görüşme planlayın.