Yapay ZekâVeri YönetişimiVeri KalitesiKVKKRAGMakine Öğrenmesi

Yapay Zekâ İçin Veri Yönetişimi Nasıl Yapılır?

Furkan Aydınöz2026-09-2819 dk
Şirket verisini yapay zekâ için hazırlayan veri yönetişimi akışı

Yapay zekâ projelerinde veri neden kritik?

Şirketlerin yapay zekâ projelerine başlarken ilk gündemi çoğu zaman model seçimidir: Hangi büyük dil modeli kullanılmalı? RAG mi kurulmalı? Fine-tuning gerekli mi? Bulut servisi mi yoksa şirket içinde çalışan bir model mi tercih edilmeli?

Ancak modelden önce çözülmesi gereken daha temel bir problem vardır: Yapay zekâ sistemi hangi veriyi, hangi amaçla, hangi yetkiyle ve hangi kalite seviyesinde kullanacak?

Bir şirketin yıllardır veri topluyor olması, bu verilerin otomatik olarak yapay zekâya hazır olduğu anlamına gelmez. Aynı müşterinin farklı sistemlerde farklı kimliklerle tutulması, eski prosedürlerin güncel belgelerle birlikte indekslenmesi, dokümanların sahiplerinin bilinmemesi, erişim yetkilerinin gereğinden geniş olması veya kişisel verilerin kullanım amacı değerlendirilmeden bir modele aktarılması AI projesinin teknik ve hukuki risklerini artırabilir.

Yapay zekâ için veri yönetişimi, bir kuruluşun AI sistemlerinde kullanılan verilerin sahipliğini, kalitesini, erişimini, güvenliğini, kökenini, kullanım amacını ve yaşam döngüsünü yönetmek için oluşturduğu politika, rol, süreç ve teknik kontroller bütünüdür.

Bu nedenle veri yönetişimi yalnızca veri ekibinin işi değildir. Hukuk, bilgi güvenliği, iş birimleri, veri mühendisliği, yazılım ve AI ekiplerinin ortak sorumluluk alanıdır.

NIST AI Risk Management Framework, AI risklerinin sistemin tasarımından kullanımına kadar yaşam döngüsü boyunca ele alınmasını ve yönetişimin diğer risk yönetimi faaliyetlerine yayılan bir fonksiyon olmasını önerir [1]. ISO/IEC 5259 serisi ise analitik ve makine öğrenmesi açısından veri kalitesini ölçme, yönetme, süreçleştirme ve yönetişim seviyesine taşıma konusunda özel standartlar sunmaktadır [2][3].

Veri yönetişimi ile veri yönetimi aynı şey mi?

İki kavram birbirine yakın olsa da aynı değildir.

Veri yönetimi, verinin günlük operasyonel olarak nasıl toplandığı, depolandığı, dönüştürüldüğü, taşındığı, yedeklendiği ve kullanıldığıyla ilgilenir.

Veri yönetişimi ise bu işlemlerin hangi kurallar altında gerçekleştirileceğini belirler.

Basit biçimde:

AlanTemel soruÖrnek
Veri yönetişimiKim, neye, neden karar verebilir?Müşteri verisine hangi AI uygulamaları erişebilir?
Veri yönetimiVeri operasyonel olarak nasıl işlenir?CRM verisi veri ambarına nasıl aktarılır?
Veri kalitesiVeri amaca uygun mu?Eksik ürün açıklamalarının oranı nedir?
Veri güvenliğiVeri nasıl korunur?Kimlik doğrulama, şifreleme ve erişim kayıtları
Veri gizliliğiKişisel veri hangi şartlarla kullanılabilir?AI sistemine aktarılan müşteri verisinin kapsamı
AI yönetişimiAI sistemi nasıl kontrol edilir?Model riskleri, insan denetimi ve değerlendirme süreçleri

Olgun bir AI ortamında bunların birbirinden kopuk yürütülmesi yerine birlikte tasarlanması gerekir.

Yapay zekâ için “kaliteli veri” ne demektir?

Veri kalitesini yalnızca “hatalı kayıt bulunmaması” şeklinde tanımlamak yetersizdir.

ISO/IEC 5259 serisi, analitik ve makine öğrenmesi için veri kalitesinin sistematik biçimde değerlendirilmesi ve yaşam döngüsü boyunca yönetilmesine yönelik standartlar içerir. ISO/IEC 5259-4:2024 özellikle veri etiketleme, değerlendirme ve yaşam döngüsü süreçlerini kapsayan bir veri kalitesi süreç çerçevesi tanımlar [2]. ISO/IEC 5259-5:2025 ise veri kalitesinin yalnızca teknik ekiplerin sorumluluğu olmadığını, yönetişim ve organizasyonel sorumluluk boyutuyla ele alınması gerektiğini ortaya koyar [3].

Bir AI kullanım senaryosunda en az şu sorular sorulmalıdır:

  • Veri doğru mu?
  • Yeterince güncel mi?
  • Eksik alanlar var mı?
  • Aynı varlık birden fazla kez kayıtlı mı?
  • Veri beklenen formatta mı?
  • Kaynağı biliniyor mu?
  • Kullanım senaryosunu temsil ediyor mu?
  • Etiketler güvenilir mi?
  • Kullanım amacıyla ilgili mi?
  • Kullanılması hukuken ve kurumsal politikalar açısından uygun mu?

Buradaki önemli nokta amaca uygunluk kavramıdır.

Bir veri seti bir uygulama için yeterli, başka bir uygulama için yetersiz olabilir.

Örneğin müşteri destek botu için hazırlanan ürün dokümanlarının eksiksiz olması yeterli görünürken, fiyat bilgileri altı ay önce güncellendiyse sistem müşterilere yanlış bilgi verebilir. Veri biçimsel olarak doğru olsa bile kullanım amacı açısından kaliteli değildir.

Şirket verisi AI projesine nasıl hazırlanmalı?

Sağlıklı bir süreç doğrudan verileri modele yüklemekle başlamamalıdır. Önce veri ortamının anlaşılması gerekir.

1. Kullanım senaryosunu tanımlayın

“Şirket verilerimizi yapay zekâda kullanalım” uygulanabilir bir proje tanımı değildir.

Önce belirli bir problem tanımlanmalıdır.

Örneğin:

  • teknik dokümanlarda soru-cevap,
  • müşteri destek temsilcisine yanıt önerme,
  • sözleşmelerden belirli maddeleri çıkarma,
  • bakım kayıtlarından arıza sınıflandırma,
  • ürün açıklaması oluşturma,
  • satış görüşmelerini sınıflandırma.

Kullanım amacı belirlendikten sonra gerekli veri daha doğru tanımlanabilir.

Aksi halde şirketin erişebildiği tüm veriyi merkezi bir AI havuzuna toplamak gereksiz maliyet, güvenlik riski ve veri koruma riski yaratabilir.

2. Veri envanteri çıkarın

Bir sonraki aşama şirketin hangi veriye sahip olduğunu belirlemektir.

Envanter yalnızca veritabanlarının listesinden oluşmamalıdır.

Örneğin:

Veri kaynağıSahibiFormatGüncellikHassasiyetAI kullanım durumu
CRMSatışYapısalGünlükYüksekİnceleme gerekli
Ürün kataloğuÜrünYapısalGünlükDüşükUygun
Teknik PDF'lerOperasyonDokümanDeğişkenOrtaTemizleme gerekli
İK kayıtlarıİnsan KaynaklarıKarmaGünlükÇok yüksekSıkı kısıtlama
Destek kayıtlarıDestekMetinSürekliYüksekAnonimleştirme/değerlendirme gerekli

Bu tabloya veri sahibi, teknik sorumlu, saklama süresi, hukuki sınıflandırma, veri kaynağı ve erişim grupları gibi alanlar da eklenebilir.

KVKK'nın Kişisel Veri Güvenliği Rehberi de kişisel veri işleme envanteri, kurumsal politikalar, risk analizleri ve erişim gibi idari ve teknik tedbirleri veri güvenliği çerçevesinde ele almaktadır [4].

3. Veri sahipliğini belirleyin

AI projelerinde sık görülen sorunlardan biri, verinin teknik olarak bulunmasına rağmen içerikten kimin sorumlu olduğunun bilinmemesidir.

Her kritik veri alanı için en azından şu roller tanımlanabilir:

Data Owner: Verinin iş açısından sahibi ve kullanım kurallarından sorumlu kişi veya birim.

Data Steward: Veri tanımları, kalite kontrolleri ve günlük yönetişim süreçleriyle ilgilenen rol.

Data Custodian: Depolama, erişim ve teknik altyapı gibi operasyonel sorumlulukları yöneten ekip.

AI / ML ekibi: Veriyi belirli AI kullanım senaryolarında kullanan teknik ekip.

Bilgi güvenliği ve hukuk/KVKK fonksiyonları: Risk, erişim, veri işleme ve uyum konularında kontrol sağlayan taraflar.

Küçük şirketlerde bunların her biri ayrı çalışan olmak zorunda değildir. Önemli olan sorumlulukların belirsiz kalmamasıdır.

Veri kökeni neden kayıt altına alınmalı?

Bir AI sistemindeki önemli sorulardan biri şudur:

Verinin kaynağı, geçirdiği dönüşümler ve kullanım geçmişi veri kökeni veya data lineage kapsamında değerlendirilir.

Örneğin bir satış tahmin modelinde kullanılan customer_revenue alanının CRM'den mi, ERP'den mi yoksa veri ambarında hesaplanan başka bir tablodan mı geldiğinin bilinmesi gerekir.

Benzer şekilde bir RAG sisteminde modele verilen bir paragraf için:

  • hangi dokümandan geldiği,
  • dokümanın sürümü,
  • ne zaman indekslendiği,
  • kim tarafından yayımlandığı,
  • geçerlilik tarihi,
  • erişim sınıfı

izlenebilir olmalıdır.

AB AI Act'in yüksek riskli AI sistemlerine ilişkin 10. maddesi, veri yönetişimi uygulamalarında veri toplama süreçleri ve veri kökeninin yanı sıra veri hazırlama, etiketleme, temizleme, güncelleme, zenginleştirme, varsayımlar, veri uygunluğu ve olası önyargıların değerlendirilmesi gibi unsurları açıkça saymaktadır [5].

Bu gereklilik her AI uygulamasının AB AI Act kapsamında yüksek riskli olduğu anlamına gelmez. Ancak söz konusu maddede tanımlanan veri yönetişimi alanları, kurumsal AI projeleri açısından yararlı bir kontrol çerçevesi sunar.

Veri temizleme AI için nasıl yapılmalı?

Veri temizleme, yalnızca boş hücreleri silmek değildir.

AI projesine göre şu işlemler gerekebilir:

  • yinelenen kayıtların belirlenmesi,
  • hatalı değerlerin düzeltilmesi,
  • tarih ve ölçü birimlerinin standartlaştırılması,
  • eksik alanların tespit edilmesi,
  • eski kayıtların işaretlenmesi,
  • bozuk dosyaların ayrılması,
  • karakter kodlama sorunlarının giderilmesi,
  • hatalı etiketlerin incelenmesi,
  • gereksiz kişisel verilerin çıkarılması,
  • erişim kapsamı dışında kalan içeriğin ayrılması.

Burada otomatik temizleme kuralları dikkatli uygulanmalıdır.

Örneğin nadir görülen bir değer otomatik olarak “hatalı veri” kabul edilirse, model açısından önemli bir istisna ortadan kaldırılabilir.

Bu nedenle temizlik işlemleri tekrar üretilebilir olmalı ve mümkün olduğunda yapılan dönüşümlerin kaydı tutulmalıdır.

RAG sistemlerinde veri hazırlama nasıl farklılaşır?

Retrieval-Augmented Generation (RAG) sistemlerinde veri hazırlama, klasik tablo temizliğinden farklı sorunlar içerir.

Şirket içi dokümanların doğrudan bir vector database'e aktarılması genellikle yeterli değildir.

Önce doküman koleksiyonunun düzenlenmesi gerekir.

Doküman geçerliliği

Aynı prosedürün 2023, 2024 ve 2026 sürümleri aynı anda indekslenirse sistem eski prosedürü getirebilir.

Bu nedenle sürüm, geçerlilik tarihi ve aktif/pasif durumu metadata olarak tutulmalıdır.

Erişim yetkileri

Bir çalışanın kaynak sistemde erişemediği dokümanı RAG üzerinden görebilmesi ciddi bir yetkilendirme problemidir.

Bu nedenle doküman erişim modeli retrieval katmanında da uygulanmalıdır.

Chunk yapısı

Dokümanların anlamsal bağlamı korunmadan parçalanması retrieval kalitesini düşürebilir.

Chunk stratejisi;

  • doküman yapısı,
  • başlıklar,
  • tablolar,
  • paragraf ilişkileri,
  • hedef sorgu tipi

dikkate alınarak belirlenmelidir.

Metadata

Her chunk için mümkün olduğunda şu bilgiler tutulabilir:

  • kaynak doküman,
  • doküman kimliği,
  • sürüm,
  • bölüm,
  • oluşturulma tarihi,
  • son güncelleme,
  • veri sahibi,
  • erişim sınıfı,
  • geçerlilik durumu.

Böylece yalnızca semantik benzerliğe değil, iş kurallarına göre de retrieval filtresi uygulanabilir.

Kişisel veriler AI sistemlerine doğrudan aktarılabilir mi?

Kişisel veri içeren bir veri setinin teknik olarak AI sistemine aktarılabilmesi, bu aktarımın otomatik olarak uygun olduğu anlamına gelmez.

6698 sayılı Kişisel Verilerin Korunması Kanunu'nun 4. maddesi kapsamında kişisel verilerin hukuka ve dürüstlük kurallarına uygun, doğru ve gerektiğinde güncel, belirli, açık ve meşru amaçlarla, işlendikleri amaçla bağlantılı, sınırlı ve ölçülü biçimde işlenmesi gerekir [6].

KVKK'nın üretken yapay zekâ rehberi de üretken AI sistemlerinin yaşam döngüsündeki kişisel veri işleme faaliyetlerini 6698 sayılı Kanun çerçevesinde değerlendirmektedir [7].

Dolayısıyla “veri elimizde zaten bulunuyor” tek başına yeterli değerlendirme değildir.

AI projesinde şu sorular ayrıca incelenmelidir:

  • Kişisel veri gerçekten gerekli mi?
  • Kullanım amacı nedir?
  • Hangi veri kategorileri işlenecek?
  • İşleme şartı nedir?
  • Verinin üçüncü taraf AI sağlayıcısına aktarımı söz konusu mu?
  • Veri nerede işleniyor?
  • Saklama politikası nedir?
  • Kullanıcı girdileri hizmet sağlayıcı tarafından nasıl işleniyor?
  • Gereksiz alanlar maskelenebilir veya anonim hale getirilebilir mi?
  • Erişim kayıtları tutuluyor mu?

KVKK'nın veri güvenliğine ilişkin açıklamalarına göre veri sorumlusu; kişisel verilerin hukuka aykırı işlenmesini ve erişilmesini önlemek ve verilerin muhafazasını sağlamak için uygun teknik ve idari tedbirleri almakla yükümlüdür [8].

Bu nedenle gizlilik kontrolü, AI sistemi tamamlandıktan sonra eklenen bir özellik değil, veri mimarisinin başlangıç koşullarından biri olmalıdır.

Her AI sistemi tüm şirket verisine erişmeli mi?

Hayır.

AI uygulamalarında uygulanabilecek temel prensiplerden biri en az ayrıcalık yaklaşımıdır.

Bir müşteri destek asistanının maaş kayıtlarına erişmesine gerek yoktur. İnsan kaynakları için geliştirilen bir uygulamanın müşteri sözleşmelerinin tamamına erişmesi de gerekmeyebilir.

Erişim modeli mümkün olduğunda kullanıcı, rol, veri sınıfı ve kullanım senaryosu seviyesinde tanımlanmalıdır.

Örneğin:

Kullanıcı → AI uygulaması → yetkilendirme → retrieval/veri katmanı → izin verilen kaynaklar

şeklinde bir kontrol zinciri kurulabilir.

Böylece AI uygulaması yeni bir “tüm verilere erişim kapısı” haline gelmez.

Yapay zekâ verilerinde güvenlik nasıl sağlanmalı?

AI veri güvenliği klasik bilgi güvenliğinden tamamen ayrı değildir.

NIST, AI güvenliğini değerlendirirken sistemin yanı sıra eğitim ve çıktı verilerinin gizlilik, bütünlük ve erişilebilirlik risklerine de dikkat çekmektedir [9].

Kurumsal ortamda değerlendirilebilecek kontroller arasında şunlar bulunur:

  • rol tabanlı veya öznitelik tabanlı erişim,
  • aktarım sırasında ve depolamada şifreleme,
  • merkezi kimlik yönetimi,
  • loglama,
  • veri maskeleme,
  • anahtar ve secret yönetimi,
  • yedekleme,
  • veri kaybı önleme kontrolleri,
  • saklama ve imha politikaları,
  • geliştirme ve üretim ortamlarının ayrılması.

KVKK'nın Kişisel Veri Güvenliği Rehberi de log kayıtları, veri maskeleme, veri kaybı önleme yazılımları, yedekleme, güvenlik duvarları, silme/yok etme/anonim hale getirme ve anahtar yönetimi gibi teknik tedbirleri örneklemektedir [4].

Veri kalitesi nasıl ölçülür?

“Verilerimiz kaliteli” ölçülebilir bir ifade değildir.

Kalite göstergeleri kullanım senaryosuna göre tanımlanmalıdır.

Örneğin:

Tamlık

Zorunlu alanların ne kadarı dolu?

Doğruluk

Kayıt gerçek durumu ne ölçüde yansıtıyor?

Güncellik

Veri iş sürecinin gerektirdiği sürede güncelleniyor mu?

Tutarlılık

Aynı bilgi farklı sistemlerde çelişiyor mu?

Benzersizlik

Aynı müşteri veya ürün gereksiz şekilde birden fazla kez kayıtlı mı?

Geçerlilik

Değerler tanımlanan veri kurallarına uyuyor mu?

Bunların her biri kullanım senaryosuna özel eşiklerle izlenebilir.

ISO/IEC 5259 serisinin 2024–2026 arasında yayımlanan bölümleri veri kalitesi terminolojisi, ölçümleri, yönetimi, süreçleri, yönetişimi ve kalite sonuçlarının görselleştirilmesi için birbirini tamamlayan çerçeveler sağlamaktadır [2][3][10].

Temsili senaryo: şirket içi bilgi asistanı

Aşağıdaki örnek tamamen temsili bir kurumsal senaryodur.

Bir üretim şirketinin çalışanların teknik prosedürler, kalite dokümanları ve bakım kılavuzları hakkında soru sorabileceği RAG tabanlı bir şirket içi asistan geliştirdiğini düşünelim.

Şirketin ortak dosya sisteminde 40.000'den fazla doküman bulunduğunu varsayalım. Buradaki sayı gerçek bir şirket veya araştırma sonucunu temsil etmez; yalnızca senaryoyu açıklamak için kullanılmıştır.

Tüm dosyaları doğrudan vector database'e aktarmak yerine önce veri yönetişimi süreci uygulanır.

İlk olarak dokümanlar sınıflandırılır:

  • aktif prosedür,
  • eski prosedür,
  • teknik kılavuz,
  • kalite belgesi,
  • taslak,
  • kişisel veri içeren doküman,
  • erişimi kısıtlı doküman.

Daha sonra her dokümana veri sahibi ve erişim seviyesi atanır.

Eski sürümler silinmek zorunda değildir; ancak AI retrieval kapsamından çıkarılabilir.

Dokümanlara sürüm ve geçerlilik metadata'sı eklenir. Kullanıcının kurumsal kimliği retrieval sorgusuna bağlanır. Böylece sistem yalnızca kullanıcının erişme yetkisine sahip olduğu belgeleri arar.

Pilot aşamada retrieval kalitesi için hazırlanmış doğrulama soruları kullanılır. Yanıtın doğru kaynağa dayanıp dayanmadığı, güncel dokümanın getirilip getirilmediği ve yetkisiz içeriğin erişilebilir olup olmadığı test edilir.

Bu yaklaşımda AI projesinin başarısı yalnızca kullanılan LLM'in kalitesine bağlı değildir. Veri koleksiyonunun yönetişimi sistem mimarisinin doğrudan parçası haline gelir.

Yapay zekâ veri yönetişimi için uygulanabilir yol haritası

Kuruluşların başlangıçta bütün şirket verisini kusursuz hale getirmesi gerekmez.

Daha uygulanabilir yaklaşım, belirli bir AI kullanım senaryosundan başlayarak yönetişim modelini geliştirmektir.

Aşama 1: Kullanım senaryosunu sınırlandırın

Şunları yazılı hale getirin:

  • AI sistemi ne yapacak?
  • Kim kullanacak?
  • Hangi kararları destekleyecek?
  • Hangi veriye ihtiyaç duyacak?
  • Hangi veriye ihtiyaç duymayacak?

Aşama 2: Veri kaynaklarını belirleyin

Kullanılacak sistemleri ve dokümanları listeleyin.

Her kaynak için:

  • sahip,
  • teknik konum,
  • veri tipi,
  • güncelleme sıklığı,
  • hassasiyet,
  • erişim seviyesi

belirleyin.

Aşama 3: Veri profilini çıkarın

Eksik kayıtları, tekrarları, format sorunlarını, eski verileri ve tutarsızlıkları ölçün.

Problemleri tahmin etmek yerine görünür hale getirin.

Aşama 4: Hukuki ve güvenlik değerlendirmesi yapın

Kişisel veri, ticari sır, müşteri verisi ve erişimi kısıtlı içerikleri sınıflandırın.

AI sistemine gerçekten aktarılması gerekmeyen alanları kapsam dışında bırakın.

Aşama 5: Veri hazırlama pipeline'ı kurun

Manuel ve tekrarlanamaz veri temizleme yerine mümkün olduğunca izlenebilir bir süreç oluşturun:

Kaynak → doğrulama → temizleme → sınıflandırma → güvenlik kontrolleri → AI veri katmanı

Aşama 6: Kalite ölçütlerini tanımlayın

Ölçütler kullanım senaryosuna göre değişmelidir.

Örneğin RAG sistemi için:

  • doğru dokümanın retrieval başarısı,
  • güncel dokümanın seçilmesi,
  • erişim filtresinin ihlal edilmemesi,
  • kaynak gösterme doğruluğu,
  • doküman güncellemesinin indekse yansıma süresi

takip edilebilir.

Aşama 7: Sürekli izleme oluşturun

Veri yönetişimi tek seferlik temizlik projesi değildir.

Yeni kaynaklar eklenir, dokümanlar güncellenir, çalışanlar değişir ve erişim yetkileri farklılaşır.

NIST AI RMF de risk yönetiminin AI yaşam döngüsü boyunca sürekli yürütülmesini öngören Govern, Map, Measure ve Manage fonksiyonlarından oluşmaktadır [1].

AI veri yönetişimi için kontrol listesi

Bir veri kaynağını AI sistemine bağlamadan önce aşağıdaki sorular cevaplanabiliyor olmalıdır:

  • Verinin kullanım amacı açık biçimde tanımlandı mı?
  • Veri sahibi belli mi?
  • Verinin kaynağı ve kökeni izlenebiliyor mu?
  • Son güncelleme tarihi biliniyor mu?
  • Veri kalite kriterleri tanımlandı mı?
  • Eksik ve tekrar kayıtlar ölçüldü mü?
  • Eski veya geçersiz içerikler işaretlendi mi?
  • Kişisel veriler sınıflandırıldı mı?
  • Kullanılması gerekmeyen hassas alanlar çıkarıldı mı?
  • Erişim yetkileri kaynak sistemle uyumlu mu?
  • AI uygulamasının servis sağlayıcısına gönderdiği veri biliniyor mu?
  • Veri saklama ve silme kuralları tanımlı mı?
  • Yapılan veri dönüşümleri kayıt altına alınıyor mu?
  • RAG kullanılıyorsa doküman sürümleri yönetiliyor mu?
  • Model veya retrieval sistemi güncel olmayan veriyi ayırt edebiliyor mu?
  • Veri kalite metrikleri düzenli ölçülüyor mu?
  • Yetkisiz veri erişimi test ediliyor mu?
  • Veri değiştiğinde AI sisteminin nasıl güncelleneceği tanımlı mı?
  • Sistemin hangi koşullarda durdurulacağı veya veri kaynağının devre dışı bırakılacağı belli mi?

Bu soruların önemli bölümüne cevap verilemiyorsa AI entegrasyonunu genişletmeden önce veri katmanındaki belirsizliklerin giderilmesi daha güvenli olacaktır.

Hangi durumlarda AI projesi ertelenmeli?

Her veri problemi AI projesinin tamamen durdurulmasını gerektirmez. Ancak bazı durumlarda model geliştirmeye devam etmek yerine veri altyapısını düzeltmek daha doğru olabilir.

Örneğin:

  • kritik verinin kaynağı bilinmiyorsa,
  • eğitim etiketleri güvenilir değilse,
  • güncel ve eski dokümanlar ayırt edilemiyorsa,
  • kullanıcıların erişim hakları uygulanamıyorsa,
  • gerekli kişisel veri değerlendirmeleri yapılmamışsa,
  • pilot sonuçlarını ölçebilecek referans veri bulunmuyorsa,
  • veri kalitesinin kabul edilebilir olup olmadığı ölçülemiyorsa.

Bu durumlarda daha güçlü bir model seçmek temel problemi çözmeyebilir.

Veri yönetişiminin maliyeti nasıl değerlendirilmelidir?

Veri yönetişimi ek operasyon oluşturur.

Şirketin ihtiyacına bağlı olarak şu maliyet kalemleri ortaya çıkabilir:

  • veri mühendisliği,
  • veri kataloglama,
  • kalite kontrolleri,
  • depolama,
  • erişim yönetimi,
  • güvenlik araçları,
  • loglama ve izleme,
  • hukuki değerlendirme,
  • veri etiketleme,
  • doküman düzenleme,
  • yönetişim süreçlerinin işletilmesi.

Ancak her şirketin ilk günden kapsamlı bir kurumsal veri yönetişimi platformu satın alması gerekmez.

Dar kapsamlı bir AI pilotunda veri envanteri, sahiplik matrisi, basit kalite kontrolleri, erişim politikaları ve otomatik veri pipeline'larıyla başlanabilir.

Sistem kritik hale geldikçe yönetişim kontrolleri de ölçeklenebilir.

ISO/IEC 42001:2023, kuruluşların AI sistemlerinin geliştirilmesi, sağlanması ve kullanımına ilişkin politika, hedef ve süreçleri bir AI yönetim sistemi içinde ele almasına yönelik gereklilikler tanımlar [11]. Bu yaklaşım veri yönetişiminin bağımsız bir teknik çalışma yerine daha geniş AI yönetişimi yapısıyla ilişkilendirilebileceğini gösterir.

Sık yapılan veri yönetişimi hataları

Bütün veriyi modele vermek

Daha fazla veri her zaman daha iyi sonuç anlamına gelmez.

Gereksiz veri maliyeti, retrieval gürültüsünü ve güvenlik kapsamını artırabilir.

Veri temizliğini tek seferlik proje görmek

Veri sürekli değiştiği için kalite kontrollerinin de tekrarlanması gerekir.

Erişim kontrolünü yalnızca uygulama arayüzünde yapmak

Kullanıcı arayüzündeki yetkilendirme yeterli olmayabilir. Veri erişimi retrieval ve veri katmanında da uygulanmalıdır.

Eski dokümanları ayırmamak

Özellikle RAG sistemlerinde eski prosedürlerin güncel belgelerle birlikte indekslenmesi yanlış bilgi üretimine zemin hazırlayabilir.

Veri sahibini tanımlamamak

Teknik ekip bir alanın yanlış olduğunu fark ettiğinde kimin karar vereceği belli değilse veri problemleri uzun süre çözümsüz kalabilir.

AI çıktı kalitesini yalnızca model performansıyla açıklamak

Sorunun kaynağı model yerine eksik, eski, çelişkili veya yanlış erişim kapsamına sahip veri olabilir.

Sonuç

Yapay zekâ için veri hazırlamak, verileri bir veritabanında toplamak veya dokümanları vector database'e aktarmaktan daha kapsamlı bir süreçtir.

Kurumsal AI sisteminin güvenilirliği; kullanılan model kadar verinin nereden geldiğine, ne kadar güncel olduğuna, hangi kalite seviyesinde tutulduğuna, kimlerin erişebildiğine ve hangi amaçla kullanılmasına izin verildiğine bağlıdır.

Bu nedenle sağlıklı başlangıç noktası “hangi modeli kullanalım?” sorusundan önce “hangi veriyi, hangi amaçla, hangi kurallarla kullanacağız?” sorusunu cevaplamaktır.

Kuruluşların bütün veri altyapısını tek seferde dönüştürmesi gerekmez. Belirli bir kullanım senaryosuyla başlayıp veri envanteri, sahiplik, kalite, güvenlik, gizlilik ve ölçüm mekanizmalarını bu kapsamda kurmak; daha sonra başarılı süreçleri diğer AI uygulamalarına genişletmek daha yönetilebilir bir yaklaşım sunar.


Sık Sorulan Sorular

Yapay zekâ için veri yönetişimi nedir?

Yapay zekâ için veri yönetişimi; AI sistemlerinde kullanılan verilerin sahipliğini, kalitesini, erişimini, güvenliğini, kullanım amacını, kökenini ve yaşam döngüsünü yöneten politika, rol ve süreçlerin bütünüdür.

Şirket verileri yapay zekâya doğrudan yüklenebilir mi?

Teknik olarak mümkün olsa bile doğrudan yükleme doğru yaklaşım olmayabilir. Önce verinin kullanım amacı, kalitesi, erişim seviyesi, güncelliği, kişisel veri içerip içermediği ve güvenlik gereksinimleri değerlendirilmelidir.

RAG için veriler nasıl hazırlanmalı?

Dokümanlar güncellik, sürüm, erişim seviyesi ve içerik kalitesi açısından incelenmeli; uygun chunk yapısı oluşturulmalı ve kaynak, sürüm, tarih, erişim sınıfı gibi metadata bilgileri mümkün olduğunca korunmalıdır.

Yapay zekâ projelerinde veri kalitesi nasıl ölçülür?

Kullanım senaryosuna göre tamlık, doğruluk, güncellik, tutarlılık, benzersizlik ve geçerlilik gibi ölçütler tanımlanabilir. Tek bir evrensel kalite skoru yerine sistemin kullanım amacına uygun metrikler tercih edilmelidir.

Kişisel veriler yapay zekâ sistemlerinde kullanılabilir mi?

Kişisel verilerin AI sistemlerinde kullanılması ayrıca veri koruma mevzuatı kapsamında değerlendirilmelidir. Verinin şirket bünyesinde bulunması tek başına her yeni AI kullanımını otomatik olarak uygun hale getirmez. Kullanım amacı, veri işleme şartları, ölçülülük, güvenlik ve aktarım gibi konular değerlendirilmelidir.

Veri yönetişimi için ayrı bir ekip gerekli mi?

Her kuruluşun ayrı bir veri yönetişimi departmanı kurması gerekmez. Ancak veri sahipliği, teknik yönetim, kalite, güvenlik ve hukuki sorumlulukların kimlerde olduğu açık biçimde tanımlanmalıdır.

Küçük şirketler veri yönetişimine nasıl başlayabilir?

Tek bir AI kullanım senaryosu seçilip ilgili veri kaynaklarının envanteri çıkarılabilir. Veri sahibi, erişim seviyesi, kalite sorunları, kişisel veri durumu ve güncelleme mekanizması tanımlandıktan sonra temel kontroller otomatikleştirilebilir.

Veri yönetişimi olmadan RAG kurulabilir mi?

Teknik olarak kurulabilir. Ancak veri güncelliği, erişim yetkileri, doküman sürümleri ve kaynak sahipliği yönetilmiyorsa sistem eski, yanlış veya kullanıcının görmemesi gereken içerikleri getirebilir. Bu nedenle kurumsal RAG sistemlerinde veri yönetişimi mimarinin önemli bir parçasıdır.


Kaynaklar

[1] National Institute of Standards and Technology (NIST)
Artificial Intelligence Risk Management Framework (AI RMF 1.0)
Yayın tarihi: 26 Ocak 2023
URL: https://www.nist.gov/publications/artificial-intelligence-risk-management-framework-ai-rmf-10
Erişim tarihi: 28 Eylül 2026
Desteklediği konu: AI risklerinin yaşam döngüsü boyunca yönetilmesi, yönetişim ve NIST AI RMF yaklaşımı.

[2] International Organization for Standardization (ISO)
ISO/IEC 5259-4:2024 — Artificial intelligence — Data quality for analytics and machine learning (ML) — Part 4: Data quality process framework
Yayın tarihi: Temmuz 2024
URL: https://www.iso.org/standard/81093.html
Erişim tarihi: 28 Eylül 2026
Desteklediği konu: Analitik ve makine öğrenmesi için veri kalitesi süreçleri, etiketleme, değerlendirme ve yaşam döngüsü yönetimi.

[3] International Organization for Standardization (ISO)
ISO/IEC 5259-5:2025 — Artificial intelligence — Data quality for analytics and machine learning (ML) — Part 5: Data quality governance framework
Yayın tarihi: Şubat 2025
URL: https://www.iso.org/standard/84150.html
Erişim tarihi: 28 Eylül 2026
Desteklediği konu: AI ve analitik sistemlerinde veri kalitesi yönetişimi, sorumlulukların belirlenmesi ve yaşam döngüsü boyunca gözetim.

[4] Kişisel Verileri Koruma Kurumu (KVKK)
Kişisel Veri Güvenliği Rehberi (Teknik ve İdari Tedbirler)
Güncel yayın: Nisan 2025
URL: https://www.kvkk.gov.tr/Icerik/4198/Kisisel-Veri-Guvenligi-Rehberi-%28Teknik-ve-Idari-Tedbirler%29
Erişim tarihi: 28 Eylül 2026
Desteklediği konu: Kişisel veri işleme envanteri, kurumsal politikalar, risk analizi, loglama, veri maskeleme, yedekleme ve diğer teknik/idari tedbirler.

[5] European Union / EUR-Lex
Regulation (EU) 2024/1689 — Artificial Intelligence Act, Article 10: Data and data governance
Yayın: 2024; konsolide metin 27 Temmuz 2026 sürümü
URL: https://eur-lex.europa.eu/legal-content/EN/TXT/?uri=CELEX:02024R1689-20260727
Erişim tarihi: 28 Eylül 2026
Desteklediği konu: Yüksek riskli AI sistemlerinde eğitim, doğrulama ve test verileri; veri kökeni, hazırlama, temizleme, etiketleme, uygunluk ve önyargı kontrolleri.

[6] Kişisel Verileri Koruma Kurumu (KVKK)
Kişisel Verilerin İşlenmesine İlişkin Temel İlkeler
URL: https://www.kvkk.gov.tr/Icerik/4189/Kisisel-Verilerin-Islenmesine-Iliskin-Temel-Ilkeler
Erişim tarihi: 28 Eylül 2026
Desteklediği konu: 6698 sayılı Kanun'un 4. maddesi kapsamındaki hukuka uygunluk, doğruluk, amaçla bağlantılılık, sınırlılık ve ölçülülük ilkeleri.

[7] Kişisel Verileri Koruma Kurumu (KVKK)
Üretken Yapay Zekâ ve Kişisel Verilerin Korunması Rehberi (15 Soruda)
URL: https://www.kvkk.gov.tr/Icerik/8547/uretken-yapay-zeka-ve-kisisel-verilerin-korunmasi-rehberi-15-soruda
Erişim tarihi: 28 Eylül 2026
Desteklediği konu: Üretken yapay zekâ yaşam döngüsündeki kişisel veri işleme faaliyetlerinin 6698 sayılı Kanun açısından değerlendirilmesi.

[8] Kişisel Verileri Koruma Kurumu (KVKK)
Veri Güvenliğine İlişkin Yükümlülükler
URL: https://www.kvkk.gov.tr/Icerik/2040/Veri-Guvenligine-Iliskin-Yukumlulukler
Erişim tarihi: 28 Eylül 2026
Desteklediği konu: Veri sorumlusunun hukuka aykırı işleme ve erişimi önleme, veriyi muhafaza etme ve uygun teknik/idari tedbirleri alma yükümlülüğü.

[9] National Institute of Standards and Technology (NIST)
AI Research — Security and Resilience
URL: https://www.nist.gov/artificial-intelligence/ai-research-security-and-resilience
Erişim tarihi: 28 Eylül 2026
Desteklediği konu: AI sistemleri ile eğitim ve çıktı verilerinin gizlilik, bütünlük ve erişilebilirlik boyutundaki güvenlik riskleri.

[10] International Organization for Standardization (ISO)
ISO/IEC TR 5259-6:2026 — Artificial intelligence — Data quality for analytics and machine learning (ML) — Part 6: Visualization framework for data quality
Yayın tarihi: Mayıs 2026
URL: https://www.iso.org/standard/86532.html
Erişim tarihi: 28 Eylül 2026
Desteklediği konu: Veri kalitesi ölçüm sonuçlarının değerlendirilmesine yönelik görselleştirme çerçevesi ve ISO/IEC 5259 veri kalitesi standardı ailesinin güncel kapsamı.

[11] International Organization for Standardization (ISO)
ISO/IEC 42001:2023 — Information technology — Artificial intelligence — Management system
Yayın tarihi: Aralık 2023
URL: https://www.iso.org/standard/42001
Erişim tarihi: 28 Eylül 2026
Desteklediği konu: Kuruluşlarda yapay zekâ yönetim sistemi kurulması, uygulanması, sürdürülmesi ve sürekli iyileştirilmesine ilişkin çerçeve.