Yapay Zekâ Halüsinasyonu Nedir?
Bir üretken yapay zekâ sisteminin verdiği cevabın akıcı, ayrıntılı ve kendinden emin görünmesi, cevabın doğru olduğu anlamına gelmez. Büyük dil modelleri (LLM), gerçekte var olmayan bir araştırmayı kaynak gösterebilir, yanlış bir tarihi kesin bilgi gibi sunabilir, verilen dokümanda bulunmayan bir hükmü dokümana atfedebilir veya eksik veriyi kendi ürettiği ayrıntılarla tamamlayabilir.
Bu davranış genellikle yapay zekâ halüsinasyonu (AI hallucination) olarak adlandırılır.
NIST, Generative AI Profile dokümanında daha teknik bir ifade olan confabulation terimini kullanır. NIST'e göre bu durum, üretken yapay zekâ sistemlerinin hatalı veya yanlış içeriği güvenli biçimde sunmasının yanı sıra girdiden veya önceki ifadelerden sapmasını da kapsayabilir [1].
Başka bir ifadeyle halüsinasyon, modelin yalnızca “yanlış cevap vermesi” değildir. Sorunun önemli tarafı, yanlış cevabın dilsel olarak oldukça ikna edici olabilmesidir.
Örneğin bir model:
- gerçekte bulunmayan bir mahkeme kararını kaynak gösterebilir,
- var olmayan bir akademik araştırmanın adını üretebilir,
- şirket politikasında bulunmayan bir kuralı varmış gibi açıklayabilir,
- bir ürünün teknik özelliğini yanlış hatırlayabilir,
- doğru kişiye yanlış unvan veya tarih atayabilir,
- verilen dokümanda olmayan bilgileri dokümandan alınmış gibi sunabilir.
Bu nedenle kurumsal yapay zekâ projelerinde asıl soru yalnızca “Model ne kadar güçlü?” değildir. Daha önemli sorulardan biri şudur:
Yapay Zekâ Neden Halüsinasyon Görür?
Halüsinasyonu anlamak için büyük dil modellerinin temel çalışma mantığını bilmek gerekir.
Bir LLM klasik anlamda sürekli güncel bir bilgi tabanında arama yaparak cevap üretmez. Temel mekanizma, verilen bağlama göre sonraki token'ın olasılığını tahmin ederek bir çıktı oluşturmaktır.
Bu mekanizma son derece doğal ve tutarlı metinler üretebilir. Ancak dilsel olasılık ile olgusal doğruluk aynı şey değildir.
NIST de üretken modellerin eğitim verilerindeki istatistiksel dağılımları yaklaşık olarak modellediğini ve LLM'lerin sonraki token veya kelimeyi tahmin etmesinin olgusal olarak yanlış ya da kendi içinde tutarsız sonuçlar üretebileceğini belirtmektedir [1].
OpenAI tarafından 2025'te yayımlanan araştırmada da halüsinasyonların yalnızca beklenmedik bir yazılım hatası olmadığı; dil modellerinin eğitim ve değerlendirme biçimleriyle bağlantılı olduğu tartışılmaktadır. Çalışma, özellikle belirsizlik durumunda “bilmiyorum” demek yerine tahminde bulunmayı ödüllendiren değerlendirme yöntemlerinin hatalı fakat kendinden emin cevapları teşvik edebileceğine dikkat çekmektedir [2].
1. Modelin bilgi eksikliği
Model sorulan bilgiyle eğitim sırasında hiç karşılaşmamış, bilgiyi yeterince öğrenememiş veya mevcut bağlam içerisinde bu bilgiye erişemiyor olabilir.
Örneğin dün yayımlanan şirket içi prosedür, yalnızca modelin önceden eğitilmiş parametrelerine dayanılarak güvenilir şekilde cevaplanamaz.
2. Eksik veya belirsiz istemler
“Şirketimizin iade prosedürünü açıkla” sorusu modele şirketin prosedürü verilmeden sorulursa model genel e-ticaret uygulamalarından hareketle makul görünen bir prosedür üretebilir.
Bu cevap dilsel olarak iyi olsa bile şirket açısından tamamen yanlış olabilir.
3. Kaynak ile cevap arasındaki kopukluk
Modele kaynak doküman verilmesi tek başına cevabın kaynağa bağlı kalacağını garanti etmez.
Model:
- kaynağı yanlış yorumlayabilir,
- birden fazla kaynaktaki bilgiyi yanlış birleştirebilir,
- kaynakta olmayan bir çıkarım yapabilir,
- retrieved context yetersiz olduğunda boşlukları kendi bilgisiyle tamamlayabilir.
Bu nedenle RAG kullanılması ile halüsinasyonun ortadan kalkması aynı şey değildir.
4. Yanlış veya yetersiz retrieval
RAG sistemlerinde cevap kalitesi yalnızca LLM'e bağlı değildir.
Kullanıcının sorusuyla ilgili doküman retrieval katmanında bulunamazsa, yanlış chunk seçilirse veya kritik bilgi bağlama ulaşmazsa model doğru cevabı üretmek için gerekli kanıttan yoksun kalabilir.
Dolayısıyla bazı “LLM halüsinasyonları” aslında retrieval pipeline'ındaki problemlerin sonucudur.
5. Belirsizlik yerine cevap üretme eğilimi
Bir sistemin her soruya cevap vermesi bekleniyorsa model bilinmeyen durumlarda da cevap üretmeye zorlanabilir.
Kurumsal sistemlerde bu nedenle “cevap yok”, “yeterli kaynak bulunamadı” veya “insan incelemesi gerekiyor” sonuçları başarısızlık olarak değerlendirilmemelidir.
Bazı durumlarda cevap vermemek, yanlış cevap vermekten daha doğrudur.
Halüsinasyon Türleri
Halüsinasyonları tek bir kategori altında değerlendirmek hata analizini zorlaştırır.
| Halüsinasyon türü | Örnek | Olası kontrol |
|---|---|---|
| Olgusal halüsinasyon | Yanlış tarih, kişi veya teknik özellik | Güvenilir dış kaynak doğrulaması |
| Kaynak halüsinasyonu | Var olmayan makale veya URL üretmek | Kaynak varlığı kontrolü |
| Kaynağa aykırı cevap | Dokümanda olmayan hükmü dokümana atfetmek | Groundedness değerlendirmesi |
| Sayısal halüsinasyon | Uydurulmuş oran veya maliyet | Veri kaynağı ve hesaplama doğrulaması |
| Bağlamsal halüsinasyon | Kullanıcı girdisindeki ayrıntıyı değiştirmek | Input-output consistency kontrolü |
| Mantıksal hata | Doğru verilerden yanlış sonuç çıkarmak | Kural tabanlı kontrol veya insan incelemesi |
| Güncellik hatası | Eski bilgiyi güncelmiş gibi vermek | Güncel veri kaynağı / arama entegrasyonu |
Bu ayrım önemlidir çünkü bütün hatalar aynı yöntemle çözülemez.
Örneğin retrieval sistemi, şirket içi bilgiye erişim sorununu azaltabilirken matematiksel bir hesaplamanın güvenilirliği için hesaplama aracına veya deterministik bir fonksiyona ihtiyaç duyulabilir.
Şirketler İçin Yapay Zekâ Halüsinasyonu Neden Önemlidir?
Bir şiir üreten sistemin yanlış bilgi oluşturması ile müşteriye sözleşme koşullarını açıklayan sistemin yanlış bilgi oluşturması aynı risk seviyesinde değildir.
Risk, yapay zekânın kullanıldığı iş sürecine göre değerlendirilmelidir.
Özellikle şu alanlarda daha sıkı kontrol gerekir:
- hukuki doküman analizi,
- finansal raporlama,
- sağlıkla ilişkili süreçler,
- insan kaynakları karar desteği,
- müşteri sözleşmeleri,
- teknik bakım talimatları,
- güvenlik prosedürleri,
- mevzuat yorumlama,
- kurumsal bilgi tabanları,
- yönetim kararlarını etkileyen analizler.
NIST, üretken yapay zekâ sistemlerindeki confabulation riskinin özellikle sonuçları önemli olan karar süreçlerinde izlenmesi gerektiğini vurgulamaktadır [1].
Buradaki kritik nokta şudur:
Halüsinasyon riski yalnızca model doğruluğu problemi değil, iş riski problemidir.
Bu nedenle bir yapay zekâ uygulamasının kabul edilebilir hata seviyesi kullanım senaryosuna göre belirlenmelidir.
RAG Halüsinasyonu Azaltır mı?
Retrieval-Augmented Generation (RAG), büyük dil modelinin yalnızca kendi parametrik bilgisine dayanması yerine dış kaynaklardan getirilen bilgiyi kullanarak cevap üretmesini sağlayan bir yaklaşımdır.
RAG yaklaşımının temel çalışması Lewis ve arkadaşları tarafından 2020'de yayımlandı. Araştırmada parametrik model belleği ile dışarıdan erişilen parametrik olmayan belleğin birlikte kullanıldığı bir yapı incelendi ve bilgi yoğun görevlerde retrieval destekli üretimin avantajları gösterildi [3].
Basitleştirilmiş bir RAG akışı şöyledir:
Kullanıcı sorusu → Retrieval → İlgili dokümanlar → LLM → Kaynaklandırılmış cevap
Örneğin şirketinizin 3.000 sayfalık teknik dokümantasyonu bulunuyorsa tüm bilginin model tarafından önceden “bilinmesi” yerine kullanıcının sorusuyla ilgili bölümler aranarak modele bağlam olarak verilebilir.
Bu yaklaşım özellikle:
- özel şirket verileri,
- sık değişen bilgiler,
- ürün dokümantasyonu,
- şirket politikaları,
- mevzuat dokümanları,
- destek bilgi tabanları
için kullanışlıdır.
Ancak RAG bir halüsinasyon kapatma düğmesi değildir.
Retrieval yanlış dokümanı getirirse model yanlış bağlam üzerinden cevap üretebilir. Doğru doküman getirildiğinde bile model kaynağın dışına çıkabilir.
Bu nedenle kurumsal bir RAG sisteminin değerlendirilmesinde en az iki farklı soru sorulmalıdır:
- Retrieval doğru bilgiyi buluyor mu?
- Model cevabını bulunan bilgiye dayandırıyor mu?
Bu ayrım yapılmadan yalnızca son cevabın değerlendirilmesi, hatanın hangi katmanda oluştuğunu belirlemeyi zorlaştırır.
Grounding Nedir?
Grounding, modelin cevabının belirli ve doğrulanabilir bilgi kaynaklarına dayandırılmasıdır.
Örneğin müşteri şu soruyu soruyor:
“Premium paket sözleşmemi istediğim zaman iptal edebilir miyim?”
Model kendi genel bilgisinden cevap vermek yerine güncel sözleşme maddesini bulur ve cevabını bu içeriğe dayandırır.
Microsoft'un Groundedness Detection dokümantasyonunda groundedness, model çıktısının sağlanan kaynak bilgilerle ne ölçüde uyumlu olduğu bağlamında ele alınmaktadır. Hizmet, kaynak materyale dayanmayan içerikleri tespit etmek amacıyla kullanılabilmektedir [4].
Grounding özellikle kurumsal uygulamalarda üç avantaj sağlar:
- cevabın doğrulanabilirliğini artırır,
- kaynağa kadar izlenebilirlik sağlayabilir,
- insan denetimini kolaylaştırır.
Buna rağmen grounding mekanizmasının kendisi de test edilmelidir. Kaynağın yanlış, eski veya eksik olması durumunda kaynağa sadık bir cevap yine yanlış olabilir.
Halüsinasyon Nasıl Azaltılır?
Tek bir teknik yerine katmanlı bir yaklaşım daha güvenlidir.
1. Modele gerekli bağlamı sağlayın
Modelin bilmesini beklediğiniz özel bilgileri açıkça sisteme sunun.
Örneğin şirket politikası hakkında cevap verecek bir sistemin şirket politikasına erişebilmesi gerekir.
Bu erişim:
- prompt context,
- RAG,
- veri tabanı sorguları,
- API'ler,
- arama sistemleri,
- araç kullanımı
üzerinden sağlanabilir.
2. Güvenilir kaynakları önceliklendirin
Retrieval sisteminin eriştiği veri havuzu kontrol edilmelidir.
Aynı konuda eski ve yeni dokümanların birlikte indekslenmesi, modelin eski prosedürü kullanmasına neden olabilir.
Dokümanlarda mümkünse:
- sürüm,
- yayın tarihi,
- geçerlilik tarihi,
- doküman sahibi,
- erişim yetkisi,
- kaynak türü
gibi metadata alanları tutulmalıdır.
3. Cevapların kaynak göstermesini sağlayın
Kaynak göstermek halüsinasyonu tek başına engellemez ancak doğrulanabilirliği artırır.
Sistem mümkünse yalnızca kaynak adını değil, kullanılan:
- dokümanı,
- sayfayı,
- paragrafı,
- URL'yi
gösterebilmelidir.
Daha sonra bu atıfların gerçekten cevabı destekleyip desteklemediği ayrıca test edilmelidir.
4. “Bilmiyorum” seçeneğini tasarlayın
Modelin her soruya cevap vermesi gerekmemelidir.
Sistem yeterli kanıt bulamadığında örneğin:
“Mevcut kaynaklarda bu soruyu doğrulayacak yeterli bilgi bulunamadı.”
şeklinde cevap verebilmelidir.
Bu yaklaşım özellikle yanlış cevabın maliyetinin yüksek olduğu sistemlerde önemlidir. OpenAI'nin halüsinasyonlar üzerine araştırması da belirsizliğin kabul edilmesi ile yanlış tahmin yapılması arasındaki ayrımın değerlendirme sistemlerinde dikkate alınması gerektiğini savunmaktadır [2].
5. Prompt sınırlarını açıkça tanımlayın
“Bu dokümanları kullanarak soruyu cevapla” yerine daha kesin talimatlar kullanılabilir:
- Yalnızca verilen kaynaklardan doğrulanabilen bilgileri kullan.
- Kaynaklarda cevap yoksa bunu açıkça belirt.
- Kaynakta bulunmayan tarih, isim veya sayı üretme.
- Her önemli iddiayı ilgili kaynakla eşleştir.
- Birbiriyle çelişen kaynakları birleştirerek yeni bir sonuç üretme; çelişkiyi belirt.
Bu talimatlar riski azaltabilir ancak güvenlik mekanizması olarak tek başına prompt'a güvenilmemelidir.
6. Yapılandırılmış çıktı kullanın
Serbest metin yerine belirli alanları bulunan çıktılar değerlendirmeyi kolaylaştırabilir.
Örneğin:
answer:
sources:
confidence:
requires_human_review:
Bu yapı model çıktısının sonraki kontrol katmanlarından geçirilmesini kolaylaştırır.
Ancak model tarafından üretilen confidence değerinin tek başına gerçek doğruluk olasılığı olarak kabul edilmemesi gerekir.
7. Deterministik işlemleri modele bırakmayın
LLM her problem için doğru araç değildir.
Kesin hesaplama gerekiyorsa:
LLM → hesaplama fonksiyonu → sonuç → LLM açıklaması
mimarisi, hesaplamanın tamamen doğal dil modeli tarafından yapılmasına göre daha kontrol edilebilir olabilir.
Benzer şekilde güncel stok bilgisi gerekiyorsa modelden stok tahmini istemek yerine doğrudan stok API'si sorgulanmalıdır.
8. İkinci bir doğrulama katmanı kullanın
Modelin ürettiği cevap doğrudan kullanıcıya gönderilmeden önce kontrol edilebilir.
Örneğin:
Retrieval → Generation → Verification → Response
Verification katmanı:
- kaynak-cümle eşleşmesi,
- groundedness,
- yasaklı iddia kontrolü,
- format doğrulaması,
- sayı kontrolü,
- business rule validation
uygulayabilir.
Microsoft'un groundedness araçları da LLM çıktılarının sağlanan kaynak materyalle uyumunu kontrol etmeye yönelik bir örnektir [4].
9. Birden fazla üretim arasındaki tutarlılığı inceleyin
SelfCheckGPT araştırması, modelin aynı konu için oluşturduğu farklı örneklerin tutarlılığından yararlanarak olgusal olmayan ifadelerin tespit edilebileceği bir yaklaşım önermektedir [5].
Bu yaklaşım her sistem için doğrudan çözüm değildir ve ek inference maliyeti yaratabilir. Buna rağmen özellikle dış doğrulama kaynağının bulunmadığı bazı değerlendirme senaryolarında yararlı bir sinyal sağlayabilir.
Halüsinasyon Ölçülmeden Yönetilemez
“Cevaplar genel olarak iyi görünüyor” üretim ortamına geçmek için yeterli değerlendirme değildir.
Kuruma özgü bir test veri seti oluşturulmalıdır.
Örneğin destek asistanı için test setinde şu kategoriler bulunabilir:
- cevabı açıkça dokümanda bulunan sorular,
- birden fazla dokümanın birleştirilmesini gerektiren sorular,
- cevabı veri tabanında bulunmayan sorular,
- eski ve yeni dokümanların çeliştiği sorular,
- kullanıcı tarafından yanlış varsayımla sorulan sorular,
- sayısal hesaplama gerektiren sorular,
- erişim yetkisi gerektiren sorular.
Ardından farklı metrikler ayrı ayrı izlenebilir.
Örnek değerlendirme metrikleri
Answer correctness: Nihai cevap doğru mu?
Groundedness: Cevaptaki iddialar sağlanan kaynaklar tarafından destekleniyor mu?
Retrieval relevance: Getirilen dokümanlar soruyla gerçekten ilgili mi?
Retrieval coverage: Cevap için gerekli bilgi retrieval sonucunda bulunmuş mu?
Citation correctness: Gösterilen kaynak gerçekten ilgili iddiayı destekliyor mu?
Abstention quality: Yeterli bilgi olmadığında sistem cevap vermekten kaçınabiliyor mu?
Bu metriklerin her biri farklı bir sistem problemini ortaya çıkarır.
İnsan Denetimi Nerede Gerekli?
Her yapay zekâ çıktısını insanın kontrol etmesi otomasyonun değerini azaltabilir. Hiçbir çıktının kontrol edilmemesi ise yüksek riskli süreçlerde kabul edilemez sonuçlar doğurabilir.
Bu nedenle risk bazlı insan denetimi daha uygulanabilir bir yaklaşımdır.
Örneğin:
| Kullanım | Risk | Yaklaşım |
|---|---|---|
| Pazarlama metni taslağı | Görece düşük | Kullanıcı düzenlemesi |
| Şirket içi bilgi arama | Orta | Kaynak gösterimi + örneklem kontrolü |
| Müşteriye sözleşme yorumu | Yüksek | Kaynak + iş kuralı + insan kontrolü |
| Kritik sağlık/finans kararı | Çok yüksek | Uzman denetimi ve kullanım alanına özgü kontroller |
AB Yapay Zekâ Tüzüğü'nün yüksek riskli yapay zekâ sistemlerine ilişkin 13. maddesi, sistemlerin çıktılarının uygun biçimde yorumlanabilmesini sağlayacak yeterli şeffaflık ve performans sınırlamalarına ilişkin bilgi öngörmektedir. 14. madde ise yüksek riskli sistemlerde insan gözetimine ilişkin hükümler içerir [6].
Bu hükümler her kurumsal chatbotun otomatik olarak “yüksek riskli sistem” olduğu anlamına gelmez. Sistemin hukuki sınıflandırılması kullanım amacına ve ilgili mevzuat kapsamına göre ayrıca değerlendirilmelidir.
Veri Güvenliği ve Kişisel Veriler
Halüsinasyonu azaltmak amacıyla daha fazla veri sağlamak yeni bir problemi beraberinde getirebilir: gereğinden fazla veri paylaşımı.
Bir RAG sistemine tüm şirket dokümanlarını indekslemek teknik olarak kolay olabilir. Ancak her kullanıcının her dokümana erişebilmesi gerektiği anlamına gelmez.
Retrieval katmanında erişim kontrolü uygulanmalıdır.
Örneğin satış çalışanı:
- genel ürün dokümantasyonunu görebilir,
- kendi müşterileriyle ilgili verilere erişebilir,
- ancak bordro veya insan kaynakları verilerine erişememelidir.
Türkiye'de kişisel veri içeren üretken yapay zekâ uygulamalarında 6698 sayılı Kişisel Verilerin Korunması Kanunu kapsamındaki yükümlülükler ayrıca değerlendirilmelidir. KVKK'nın “Üretken Yapay Zekâ ve Kişisel Verilerin Korunması Rehberi”, üretken yapay zekâ sistemlerindeki kişisel veri işleme faaliyetlerini KVKK çerçevesinde ele almaktadır [7].
Bu nedenle halüsinasyon azaltma mimarisi tasarlanırken aynı anda:
- veri minimizasyonu,
- erişim kontrolü,
- yetkilendirme,
- loglama,
- saklama politikaları,
- hassas veri yönetimi
de düşünülmelidir.
Temsili Kurumsal Senaryo
Aşağıdaki örnek tamamen temsili bir senaryodur.
Bir üretim şirketinin bakım ekibi, binlerce sayfalık makine kullanım ve bakım dokümanında bilgi aramak için bir yapay zekâ asistanı geliştirmek istiyor.
İlk prototipte PDF'ler sisteme yükleniyor ve kullanıcı soruları RAG üzerinden cevaplanıyor.
Ancak testlerde üç problem görülüyor:
- Eski makine modellerine ait dokümanlar retrieval sonuçlarına karışıyor.
- Bazı soruların cevabı kaynaklarda bulunmadığında model kendi genel bilgisini kullanıyor.
- Kaynak gösterilmesine rağmen bazı kaynaklar verilen cevabı doğrudan desteklemiyor.
Sistem bunun üzerine yeniden tasarlanıyor.
Dokümanlara:
- makine modeli,
- seri,
- doküman sürümü,
- yayın tarihi,
- geçerlilik durumu
metadata olarak ekleniyor.
Retrieval yalnızca ilgili makine ve geçerli dokümanlar üzerinde çalışıyor.
Model için ayrıca şu kural tanımlanıyor:
Yeterli kaynak bulunamadığında bakım talimatı üretme.
Kritik bakım işlemlerinde cevap doğrudan uygulanabilir talimat olarak değil, ilgili doküman bölümü ve uzman incelemesi gerektiren bir öneri olarak gösteriliyor.
Bu senaryonun temel mesajı şudur:
Halüsinasyon problemi yalnızca “daha iyi model seçerek” çözülmeye çalışılmamıştır. Veri, retrieval, generation, verification ve insan denetimi birlikte tasarlanmıştır.
Kurumsal Halüsinasyon Kontrol Listesi
Bir üretken yapay zekâ uygulamasını canlıya almadan önce aşağıdaki sorular cevaplanmalıdır:
- Sistemin hangi kaynaklardan cevap üretmesine izin verildiği tanımlandı mı?
- Kaynakların güncelliği ve sürümleri takip ediliyor mu?
- Retrieval katmanında kullanıcı bazlı erişim kontrolü bulunuyor mu?
- Cevap için yeterli bilgi olmadığında sistem cevap vermekten kaçınabiliyor mu?
- Üretilen kaynakların gerçekten var olduğu kontrol ediliyor mu?
- Kaynakların ilgili iddiayı destekleyip desteklemediği ölçülüyor mu?
- Kuruma özgü değerlendirme veri seti oluşturuldu mu?
- Cevap doğruluğu ve groundedness ayrı ayrı ölçülüyor mu?
- Kritik kullanım alanlarında insan inceleme noktaları belirlendi mi?
- Model, prompt veya retrieval değişikliklerinden sonra testler yeniden çalıştırılıyor mu?
- Kişisel ve hassas verilerin modele gönderilmesine ilişkin kurallar tanımlandı mı?
- Hatalı cevaplar loglanıp kategorize ediliyor mu?
- Kabul edilebilir hata kriterleri kullanım senaryosuna göre belirlendi mi?
- Sistemin durdurulmasını veya insan sürecine aktarılmasını gerektiren eşikler tanımlandı mı?
Bu soruların çoğuna cevap verilemiyorsa sistem teknik olarak çalışıyor olsa bile üretim ortamına geçmek için yeterince kontrol edilmiş olmayabilir.
Halüsinasyon Azaltma Mimarisi Nasıl Kurulur?
Kurumsal uygulamalarda pratik bir mimari şu katmanlardan oluşabilir:
1. Veri katmanı
Onaylanmış ve güncel kaynakların tutulduğu alan.
2. Retrieval katmanı
Soruyla ilgili bilginin bulunması.
Burada semantic search, keyword search veya hibrit retrieval gibi yöntemler kullanılabilir.
3. Context assembly
Bulunan dokümanların modele gönderilecek bağlama dönüştürülmesi.
4. Generation
Modelin yalnızca izin verilen bağlam ve araçları kullanarak cevap üretmesi.
5. Verification
Üretilen iddiaların kaynaklarla uyumunun kontrol edilmesi.
6. Business rules
Kesinlikle uygulanması gereken şirket kurallarının deterministik olarak kontrol edilmesi.
7. Human escalation
Belirsiz veya yüksek riskli cevapların insana aktarılması.
8. Observability ve evaluation
Gerçek kullanıcı sorgularında oluşan hata türlerinin ölçülmesi ve sistem değişikliklerinin regression testlerinden geçirilmesi.
Bu mimaride LLM sistemin tamamı değil, yalnızca bileşenlerinden biridir.
Maliyet ve Performans Dengesi
Halüsinasyonu azaltmak genellikle ek işlem gerektirir.
Örneğin:
- daha fazla retrieval sorgusu,
- reranking,
- ikinci modelle doğrulama,
- web veya veri tabanı sorguları,
- birden fazla inference,
- insan incelemesi
gecikme ve maliyeti artırabilir.
Bu nedenle her kullanım senaryosuna maksimum doğrulama katmanı eklemek doğru yaklaşım değildir.
Düşük riskli bir içerik taslağında hafif bir kontrol yeterli olabilirken finansal karar destek sisteminde çok daha sıkı doğrulama gerekebilir.
Optimizasyon hedefi:
“Sıfır halüsinasyon” iddiası değil, kullanım senaryosunun riskine uygun ölçülebilir güvenilirlik seviyesidir.
Sık Yapılan Hatalar
“Daha büyük model kullanırsak sorun çözülür”
Daha yetenekli modeller bazı görevlerde daha iyi performans gösterebilir ancak model büyüklüğü tek başına doğruluk garantisi değildir. Halüsinasyon, güncel büyük dil modellerinde de tamamen ortadan kalkmış değildir [2].
“RAG kurduk, artık halüsinasyon olmaz”
RAG dış bilgiye erişimi sağlar. Retrieval hataları ve generation sırasında kaynaktan sapma yine mümkündür.
“Kaynak gösteriyorsa bilgi doğrudur”
Model gerçek olmayan kaynak üretebilir veya gerçek bir kaynağı yanlış iddiaya bağlayabilir.
Kaynak varlığı ve citation correctness ayrı ayrı kontrol edilmelidir.
“Prompt'a 'halüsinasyon yapma' yazmak yeterli”
Prompt engineering faydalı olabilir ancak kurumsal güvenilirlik mekanizmasının tamamı olamaz.
“Demo doğru çalıştıysa sistem hazırdır”
Birkaç örnek sorgu gerçek kullanıcı dağılımını temsil etmez.
Edge case'ler, cevapsız sorular, eski bilgiler, yanlış kullanıcı varsayımları ve adversarial girdiler ayrıca test edilmelidir.
Hangi Durumlarda Üretken Yapay Zekâ Kullanılmamalı?
Bazı problemler için LLM kullanmak gereksiz risk yaratabilir.
Örneğin kesin bir veritabanı sorgusunun sonucu gerekiyorsa:
“Bu müşterinin ödenmemiş faturası ne kadar?”
sorusunun cevabını modelin tahmin etmesi yerine muhasebe sisteminden deterministik olarak almak gerekir.
Benzer biçimde:
- kesin matematiksel hesaplamalar,
- yetkilendirme kararları,
- ödeme işlemleri,
- kritik güvenlik kontrolleri,
- değişmez iş kuralları
mümkün olduğunda deterministik sistemlerle uygulanmalıdır.
LLM bu sistemlerin yerine geçmek yerine doğal dil arayüzü veya orkestrasyon katmanı olarak kullanılabilir.
Sonuç
Yapay zekâ halüsinasyonu, üretken modellerin gerçek dışı, kaynak tarafından desteklenmeyen veya bağlamla çelişen içerikler oluşturabilmesi problemidir. Akıcı ve güvenilir görünen dil, cevabın doğruluğunun kanıtı değildir.
Kurumsal sistemlerde çözüm yalnızca daha güçlü bir model seçmekten geçmez.
Güvenilir bir yapı; doğru veri kaynakları, RAG veya diğer grounding yöntemleri, kaynak doğrulaması, ölçülebilir değerlendirme, iş kuralları, erişim kontrolü ve gerektiğinde insan denetiminin birlikte uygulanmasını gerektirir.
En önemli tasarım ilkelerinden biri de modelin her soruya cevap vermek zorunda olmadığını kabul etmektir. Yeterli kanıt bulunmadığında sistemin bunu açıkça belirtmesi, özellikle yüksek riskli süreçlerde yanlış fakat ikna edici bir cevap üretmesinden daha güvenli olabilir.
Sık Sorulan Sorular
Yapay zekâ halüsinasyonu ne demek?
Yapay zekâ halüsinasyonu, üretken yapay zekâ sisteminin yanlış, uydurulmuş, kaynak tarafından desteklenmeyen veya mevcut bağlamla çelişen bir bilgiyi cevap olarak üretmesidir.
ChatGPT ve diğer LLM'ler neden halüsinasyon görür?
LLM'ler metin üretirken sonraki token'ları olasılıksal olarak tahmin eder. Dilsel olarak olası bir cevap her zaman olgusal olarak doğru değildir. Bilgi eksikliği, yetersiz bağlam, belirsiz sorular ve sistemin bilinmeyen durumlarda tahminde bulunması halüsinasyona katkıda bulunabilir.
RAG halüsinasyonu tamamen engeller mi?
Hayır. RAG, modele dış kaynaklardan bilgi sağlayarak riski azaltabilir ancak retrieval yanlış bilgi getirirse veya model getirilen kaynağın dışına çıkarsa hatalı cevap yine oluşabilir.
Prompt engineering halüsinasyonu önleyebilir mi?
İyi tasarlanmış promptlar modeli kaynaklara bağlı kalmaya ve bilgi bulunmadığında bunu belirtmeye yönlendirebilir. Ancak prompt engineering tek başına güvenilirlik garantisi değildir ve diğer kontrol katmanlarıyla birlikte kullanılmalıdır.
Yapay zekâ cevabının doğru olup olmadığı nasıl kontrol edilir?
Cevapların güvenilir kaynaklarla eşleştirilmesi, groundedness ve citation correctness değerlendirmeleri, kuruma özgü test setleri, deterministik kontroller ve riskli durumlarda insan incelemesi kullanılabilir.
Modelin kaynak göstermesi halüsinasyonu önler mi?
Hayır. Model gerçek olmayan bir kaynak oluşturabilir veya gerçek bir kaynağı desteklemediği bir iddiaya bağlayabilir. Bu nedenle kaynakların hem varlığı hem de iddiayı gerçekten destekleyip desteklemediği kontrol edilmelidir.
Halüsinasyon tamamen ortadan kaldırılabilir mi?
Üretken yapay zekâ sistemlerinde her gerçek dünya senaryosu için sıfır halüsinasyon garantisi vermek güvenilir bir yaklaşım değildir. Bunun yerine hata oranlarının ölçülmesi, riskli cevapların yakalanması ve gerektiğinde sistemin cevap vermekten kaçınması hedeflenmelidir.
Şirketler halüsinasyon riskini nasıl ölçebilir?
Kuruma özgü test veri setleri hazırlanarak answer correctness, groundedness, retrieval relevance, retrieval coverage, citation correctness ve doğru abstention davranışı gibi metrikler ayrı ayrı ölçülebilir.
Kaynaklar
[1] National Institute of Standards and Technology (NIST)
Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile (NIST AI 600-1)
Yayın tarihi: 26 Temmuz 2024; NIST sayfası son güncelleme: 8 Nisan 2026
URL: https://doi.org/10.6028/NIST.AI.600-1
Erişim tarihi: 28 Eylül 2026
Desteklediği konu: Generative AI sistemlerinde confabulation/halüsinasyon tanımı, oluşum mekanizması, bilgi bütünlüğü ve risk yönetimi.
[2] OpenAI — Adam Kalai, Santosh Vempala ve diğer katkıda bulunanlar
Why Language Models Hallucinate
Yayın tarihi: 5 Eylül 2025
URL: https://openai.com/index/why-language-models-hallucinate/
Erişim tarihi: 28 Eylül 2026
Desteklediği konu: Dil modellerinin neden halüsinasyon üretebildiği, next-token prediction, belirsizlik, tahmin ve abstention ilişkisi.
[3] Patrick Lewis, Ethan Perez, Aleksandra Piktus ve diğerleri
Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks
Yayın tarihi: 22 Mayıs 2020
URL: https://arxiv.org/abs/2005.11401
Erişim tarihi: 28 Eylül 2026
Desteklediği konu: Retrieval-Augmented Generation yaklaşımının temel mimarisi ve parametrik modellerin dış bilgi kaynaklarıyla desteklenmesi.
[4] Microsoft
Groundedness Detection in Azure AI Content Safety
URL: https://learn.microsoft.com/en-us/azure/ai-services/content-safety/concepts/groundedness
Erişim tarihi: 28 Eylül 2026
Desteklediği konu: Groundedness ve ungroundedness kavramları, LLM cevaplarının sağlanan kaynak materyalle uyumunun değerlendirilmesi.
[5] Potsawee Manakul, Adian Liusie, Mark Gales
SelfCheckGPT: Zero-Resource Black-Box Hallucination Detection for Generative Large Language Models
EMNLP 2023, Aralık 2023
URL: https://aclanthology.org/2023.emnlp-main.557/
DOI: https://doi.org/10.18653/v1/2023.emnlp-main.557
Erişim tarihi: 28 Eylül 2026
Desteklediği konu: Birden fazla model çıktısının tutarlılığını kullanarak olgusal olmayan ifadelerin tespit edilmesine yönelik SelfCheckGPT yaklaşımı.
[6] Avrupa Parlamentosu ve Avrupa Birliği Konseyi
Regulation (EU) 2024/1689 — Artificial Intelligence Act
Tarih: 13 Haziran 2024; Official Journal yayımı: 12 Temmuz 2024
URL: https://eur-lex.europa.eu/eli/reg/2024/1689/oj
Erişim tarihi: 28 Eylül 2026
Desteklediği konu: Yüksek riskli yapay zekâ sistemlerinde şeffaflık, performans sınırlamalarına ilişkin bilgi ve insan gözetimi gereklilikleri.
[7] Kişisel Verileri Koruma Kurumu (KVKK)
Üretken Yapay Zekâ ve Kişisel Verilerin Korunması Rehberi (15 Soruda)
URL: https://www.kvkk.gov.tr/Icerik/8547/uretken-yapay-zeka-ve-kisisel-verilerin-korunmasi-rehberi-15-soruda
Erişim tarihi: 28 Eylül 2026
Desteklediği konu: Üretken yapay zekâ sistemlerinde kişisel veri işleme faaliyetlerinin 6698 sayılı Kişisel Verilerin Korunması Kanunu kapsamında değerlendirilmesi.
