Bir yapay zekâ sisteminin teknik olarak çalışması, projenin başarılı olduğu anlamına gelmez. Bir müşteri hizmetleri asistanı doğru cevaplar üretebilir ancak çalışanların iş yükünü azaltmayabilir. Bir doküman analiz sistemi işlem süresini kısaltabilir ancak hata maliyetini yükseltebilir. Üretken yapay zekâ uygulaması çalışanlar tarafından yoğun biçimde kullanılabilir fakat oluşturduğu ekonomik değer, lisans ve operasyon maliyetlerini karşılamayabilir.
Bu nedenle yapay zekâ projelerinde başarı ölçümü, model performansından daha geniş bir çerçevede yapılmalıdır.
Temel yaklaşım şudur:
NIST AI Risk Management Framework (AI RMF), yapay zekâ sistemlerinin yalnızca performans açısından değil, yaşam döngüsü boyunca risk ve etkileri açısından da ölçülmesini önerir. Framework'ün "Measure" fonksiyonu nicel, nitel veya karma yöntemlerle performansın, güvenilirlik özelliklerinin ve risklerin değerlendirilmesini kapsar [1][2].
Dolayısıyla iyi tasarlanmış bir KPI sistemi yalnızca "model ne kadar doğru?" sorusuna değil, "bu sistem işletmeye ne kazandırıyor, bunun karşılığında hangi maliyetleri ve riskleri oluşturuyor?" sorusuna cevap vermelidir.
Yapay zekâ projesinde başarı ne demektir?
Başarı tanımı kullanım senaryosuna göre değişir.
Bir müşteri hizmetleri yapay zekâsında amaç:
- çözüm süresini azaltmak,
- temsilci başına iş yükünü düşürmek,
- müşteri deneyimini korumak veya geliştirmek
olabilir.
Bir üretim sisteminde amaç:
- plansız duruşları azaltmak,
- kalite problemlerini daha erken tespit etmek,
- bakım süreçlerini optimize etmek
olabilir.
Bir yazılım geliştirme asistanında ise amaç:
- belirli geliştirme işlerini hızlandırmak,
- hata oranını artırmadan teslim süresini azaltmak,
- geliştiricilerin tekrarlayan işlere ayırdığı zamanı düşürmek
olabilir.
Bu nedenle KPI seçimi teknolojiden değil iş probleminden başlamalıdır.
Google Cloud'un yapay zekâ kullanım senaryolarına ilişkin dokümantasyonu da ölçülebilir iş hedefinin başlangıçta belirlenmesini; finansal kazanç, operasyonel verimlilik ve müşteri deneyimi gibi sonuçların başarı kriterleri arasında değerlendirilmesini önerir [3].
KPI ve ROI arasındaki fark nedir?
KPI (Key Performance Indicator), projenin belirlenen hedeflere doğru ilerleyip ilerlemediğini ölçen göstergedir.
ROI (Return on Investment) ise yatırım sonucunda elde edilen ekonomik getiriyi yatırım maliyetiyle karşılaştırır.
Basitleştirilmiş ROI formülü şöyledir:
ROI (%) = (Toplam finansal fayda − toplam yatırım maliyeti) / toplam yatırım maliyeti × 100
Örneğin bir sistemin yıllık ölçülebilir finansal faydasının 1.200.000 TL, toplam yıllık maliyetinin 800.000 TL olduğu varsayılsın:
ROI = (1.200.000 − 800.000) / 800.000 × 100 = %50
Ancak bu hesap yalnızca kullanılan fayda ve maliyet varsayımları güvenilir olduğu ölçüde anlamlıdır.
Ayrıca her KPI doğrudan finansal değildir.
| Ölçüm | Örnek | Ne gösterir? |
|---|---|---|
| İş KPI'ı | Ortalama işlem süresi | Operasyonel etki |
| Finansal KPI | İşlem başına maliyet | Ekonomik etki |
| Teknik KPI | Doğru yanıt oranı | Sistem kalitesi |
| Kullanım KPI'ı | Aktif kullanıcı oranı | Benimsenme |
| Risk KPI'ı | Kritik hata sayısı | Operasyonel risk |
| ROI | Fayda / yatırım ilişkisi | Finansal yatırım sonucu |
Bir AI projesinin sağlıklı değerlendirilmesi için bunların birkaçının birlikte izlenmesi gerekir.
En önemli yapay zekâ KPI kategorileri
1. İş sonucu KPI'ları
İlk kategori doğrudan çözülmek istenen probleme bağlanmalıdır.
Örneğin:
- işlem süresi,
- talep çözüm süresi,
- manuel işlem sayısı,
- tekrar işleme oranı,
- hata nedeniyle oluşan operasyon sayısı,
- çalışan başına tamamlanan işlem,
- satış dönüşüm oranı,
- müşteri bekleme süresi.
Buradaki kritik nokta, yapay zekâ kullanılmadan önceki durumun ölçülmesidir.
Buna baseline, yani başlangıç seviyesi denebilir.
Örneğin AI öncesinde bir işlemin ortalama süresi 18 dakika ise AI sonrasında 11 dakikaya düşmesi anlamlı biçimde değerlendirilebilir. Başlangıç verisi bulunmuyorsa "AI sayesinde süreç hızlandı" ifadesini doğrulamak çok daha güç hale gelir.
2. Teknik performans KPI'ları
Teknik metrikler kullanım senaryosuna göre seçilmelidir.
Klasik makine öğrenmesi uygulamalarında:
- precision,
- recall,
- F1 score,
- false positive rate,
- false negative rate
gibi ölçüler kullanılabilir.
Üretken yapay zekâ ve LLM tabanlı sistemlerde ise değerlendirme daha karmaşıktır. Örneğin:
- cevap doğruluğu,
- verilen bağlama bağlılık,
- görev tamamlama oranı,
- yapılandırılmış çıktı geçerliliği,
- kaynak doğruluğu,
- araç çağrısı başarı oranı,
- başarısız işlem oranı,
- insan müdahalesi gerektiren işlem oranı
izlenebilir.
NIST, yapay zekâ risklerinin ve güvenilirlik özelliklerinin uygun metriklerle değerlendirilmesini, ölçülemeyen özelliklerin ise belgelenmesini önerir. Framework ayrıca sistemlerin dağıtımdan önce ve operasyon sırasında düzenli biçimde test edilmesini öngörür [2].
Dolayısıyla "accuracy %92" gibi tek bir rakam, çoğu kurumsal AI sistemi için yeterli başarı göstergesi değildir.
3. Operasyonel KPI'lar
Model laboratuvar ortamında başarılı olsa bile üretimde ekonomik veya operasyonel olarak sorunlu olabilir.
Bu nedenle şu göstergeler de takip edilmelidir:
- yanıt süresi,
- sistem kullanılabilirliği,
- başarısız istek oranı,
- işlem başına API maliyeti,
- token veya inference maliyeti,
- insan müdahalesine yönlendirilen işlem oranı,
- hata sonrası toparlanma süresi,
- günlük/aylık işlem hacmi.
Özellikle AI agent sistemlerinde model çağrısı dışında API'ler, veritabanları, arama sistemleri ve üçüncü taraf araçlar da sürece dahil olabilir. Dolayısıyla yalnızca LLM performansını izlemek uçtan uca sistem performansını göstermez.
4. Kullanıcı benimseme KPI'ları
Teknik olarak başarılı fakat kullanılmayan bir sistem iş değeri oluşturamaz.
Bu nedenle kullanıcı davranışları ayrıca ölçülmelidir.
Örneğin:
- aktif kullanıcı oranı,
- tekrar kullanım oranı,
- hedef kullanıcı grubundaki penetrasyon,
- AI destekli gerçekleştirilen işlem oranı,
- AI çıktısının kullanıcı tarafından kabul edilme oranı,
- manuel yönteme dönüş oranı.
Ancak kullanım hacmi tek başına başarı değildir.
Bir aracın çok kullanılması ekonomik değer oluşturduğunu kanıtlamaz. Bu nedenle benimsenme metrikleri mutlaka iş sonuçlarıyla birlikte değerlendirilmelidir.
Microsoft'un kurumsal AI değer ölçüm yaklaşımı da benimsenme, değer, yönetişim ve risk göstergelerinin dengeli biçimde izlenmesini; ROI ve önlenen maliyet gibi sonuç göstergelerinin tek başına kullanılmamasını önerir [4].
5. Risk ve güvenilirlik KPI'ları
Yapay zekâ projelerinde klasik yazılım projelerinden farklı riskler bulunabilir.
Örneğin:
- yanlış bilgi üretimi,
- uygunsuz içerik,
- yetkisiz veri erişimi,
- kişisel veri sızıntısı,
- ayrımcı sonuçlar,
- hatalı otomatik kararlar,
- açıklanamayan çıktılar,
- model veya veri değişiminden kaynaklanan performans bozulması.
OECD AI İlkeleri, yapay zekâ aktörlerinin sistemlerin yaşam döngüsü boyunca izlenebilirlik sağlamasını ve sistematik risk yönetimi uygulamasını önerir [5].
Bu nedenle özellikle kritik sistemlerde aşağıdaki göstergeler izlenebilir:
- kritik hata sayısı,
- güvenlik olayı sayısı,
- politika ihlali oranı,
- yanlış otomasyon oranı,
- insan tarafından geri çevrilen karar oranı,
- kişisel veri içeren uygunsuz çıktı sayısı,
- yüksek riskli olayların çözüm süresi.
Bu metriklerin eşikleri kullanım senaryosunun risk seviyesine göre belirlenmelidir.
Finansal sonucu KPI sistemine nasıl bağlamalısınız?
Bu makalenin odağı KPI ve değerlendirme tasarımıdır. Ayrıntılı TCO, nakit akışı, NPV, IRR ve senaryo modellemesi ayrı bir finansal analiz gerektirir. Burada ROI, KPI sistemindeki sonuç göstergelerinden biri olarak ele alınır; ayrıntılı hesaplama 7. makaledeki yatırım getirisi rehberine bırakılır.
Finansal faydaları belirleyin
AI projelerinin ekonomik etkileri genel olarak birkaç grupta değerlendirilebilir.
Maliyet azaltımı: Daha az manuel işlem, daha düşük dış kaynak maliyeti veya daha düşük operasyon maliyeti.
Kapasite artışı: Aynı ekip aynı sürede daha fazla işlem gerçekleştirebilir.
Ancak burada önemli bir ayrım vardır:
zaman tasarrufu ≠ otomatik olarak nakit tasarrufu
Bir çalışanın ayda 10 saat kazanması şirketin doğrudan 10 saatlik ücret maliyetini ortadan kaldırdığı anlamına gelmez. Kazanılan zamanın başka üretken faaliyetlere aktarılıp aktarılmadığı ölçülmelidir.
Gelir etkisi: Bazı AI sistemleri satış dönüşümü, çapraz satış, müşteri kaybı veya fiyatlama gibi gelirle ilişkili süreçleri etkileyebilir.
Burada nedensellik problemi önemlidir. Gelirdeki artışın ne kadarının gerçekten AI sisteminden kaynaklandığını göstermek için mümkün olduğunda kontrollü karşılaştırmalar kullanılmalıdır.
Toplam AI maliyetini hesaplarken neler dahil edilmeli?
Sadece API faturası üzerinden ROI hesaplamak ciddi biçimde yanıltıcı olabilir.
Toplam sahip olma maliyeti şu kalemleri içerebilir:
- model/API kullanımı,
- bulut altyapısı,
- vektör veritabanı veya veri altyapısı,
- yazılım lisansları,
- entegrasyon geliştirme,
- veri hazırlama,
- test ve değerlendirme,
- güvenlik çalışmaları,
- çalışan geliştirme maliyeti,
- izleme ve observability,
- bakım,
- kullanıcı eğitimi,
- insan denetimi,
- uyum ve hukuk çalışmaları.
Google Cloud'un AI değer ölçüm yaklaşımı da maliyetlerin yalnızca teknoloji harcamalarından ibaret görülmemesi ve değer sürücülerinin ölçülebilir iş sonuçlarıyla ilişkilendirilmesi gerektiğini vurgular [3][6].
Baseline neden zorunludur?
Bir AI projesinde en sık yapılan ölçüm hatalarından biri sistem devreye girdikten sonra KPI belirlemektir.
Örneğin proje sonrasında "Ortalama işlem süresi 8 dakika." bilgisi tek başına fazla anlam taşımaz.
AI öncesindeki süre bilinmiyorsa değişim hesaplanamaz.
Bu nedenle pilot başlamadan önce en azından şu bilgiler kaydedilmelidir:
- mevcut işlem süresi,
- mevcut hata oranı,
- mevcut işlem maliyeti,
- mevcut kapasite,
- mevcut kalite göstergeleri,
- kullanıcı memnuniyeti,
- mevcut insan müdahalesi oranı.
Ardından AI destekli süreç aynı ölçüler üzerinden değerlendirilmelidir.
Leading ve lagging KPI'lar birlikte kullanılmalı
Bazı göstergeler sonucu erken haber verirken bazıları gerçekleşmiş sonucu ölçer.
Leading indicator örnekleri:
- aktif kullanım,
- AI önerisinin kabul oranı,
- görev başarı oranı,
- hata eğilimi,
- insan müdahalesi oranı.
Lagging indicator örnekleri:
- maliyet azalması,
- gelir artışı,
- müşteri kaybındaki değişim,
- ROI.
Microsoft'un değer ölçüm yaklaşımı da erken yönlendirici göstergelerle gerçekleşmiş sonuç göstergelerinin birlikte kullanılmasının önemini vurgular [4].
Bu ayrım önemlidir çünkü ROI'nin oluşmasını beklemek aylar sürebilir. Leading KPI'lar proje yanlış yönde ilerliyorsa bunu daha erken gösterebilir.
AI projesi için ölçüm çerçevesi nasıl kurulmalı?
1. İş problemini tanımlayın
"Şirketimizde yapay zekâ kullanacağız" ölçülebilir bir hedef değildir.
Bunun yerine:
"Müşteri taleplerinin sınıflandırılması ve yanıt taslağı hazırlanması için harcanan süreyi, kalite seviyesini koruyarak azaltmak."
gibi bir problem tanımı kullanılabilir.
2. Baseline oluşturun
AI olmadan mevcut süreç ölçülür.
Örneğin:
- ortalama işlem süresi,
- günlük işlem hacmi,
- hata oranı,
- işlem başına maliyet.
3. KPI'ları seçin
Her kategoriden onlarca gösterge seçmek yerine karar vermeyi sağlayacak küçük bir metrik seti oluşturmak daha işlevseldir.
Örneğin:
- İş: işlem süresi
- Teknik: kabul edilebilir çıktı oranı
- Operasyon: işlem başına AI maliyeti
- Benimsenme: AI destekli işlem oranı
- Risk: kritik hata oranı
- Finans: işlem başına toplam maliyet
4. Kabul ve durdurma eşikleri belirleyin
KPI'ların yalnızca izlenmesi yeterli değildir.
Önceden şu sorular cevaplanmalıdır:
- Hangi performans seviyesi pilotun başarılı sayılmasını sağlar?
- Hangi hata seviyesi kabul edilemez?
- Hangi maliyet seviyesinde proje ekonomik olmaktan çıkar?
- Hangi risk gerçekleşirse sistem durdurulur?
- Hangi durumlarda insan onayı zorunludur?
Bu yaklaşım, sonuç görüldükten sonra başarı kriterlerinin değiştirilmesini engeller.
5. Pilot ve kontrol grubunu karşılaştırın
Mümkün olduğunda AI destekli süreç mevcut yöntemle karşılaştırılmalıdır.
Bu karşılaştırma:
- önce/sonra analizi,
- kullanıcı grupları,
- işlem grupları,
- A/B testi
gibi yöntemlerle yapılabilir.
Amaç, gözlenen değişimin gerçekten AI uygulamasıyla ilişkili olup olmadığını daha güvenilir biçimde değerlendirmektir.
Temsili kurumsal senaryo
Aşağıdaki örnek tamamen temsili bir senaryodur; gerçek bir şirket veya proje sonucunu ifade etmez.
Bir e-ticaret şirketinin müşteri destek ekibinin günde yüksek sayıda yazılı talep aldığını düşünelim.
Şirket, gelen talepleri sınıflandıran, bilgi tabanından ilgili içeriği bulan ve müşteri temsilcisine yanıt taslağı hazırlayan bir AI sistemi geliştiriyor.
Amaç çalışanı tamamen kaldırmak değil, yanıt hazırlama süresini azaltmak.
Pilot öncesinde şirket şu baseline değerlerini topluyor:
- talep başına ortalama çalışma süresi,
- günlük temsilci kapasitesi,
- yeniden açılan talep oranı,
- kalite kontrolünden geçemeyen yanıt oranı.
Pilot sırasında bunlara şu AI metrikleri ekleniyor:
- önerilen yanıtın kabul oranı,
- insan tarafından düzenleme oranı,
- yanlış bilgi içeren çıktı oranı,
- talep başına AI maliyeti,
- sistem hata oranı.
Pilot sonunda yalnızca "yanıt süresi azaldı mı?" sorusuna bakılmıyor.
Aynı zamanda:
- Hız arttı mı?
- Kalite korundu mu?
- Temsilci gerçekten zaman kazandı mı?
- AI maliyeti ekonomik avantajı ortadan kaldırıyor mu?
- Kritik hata veya veri güvenliği riski oluştu mu?
soruları birlikte değerlendiriliyor.
Bu yöntem, teknik olarak çalışan bir prototiple ekonomik olarak sürdürülebilir bir AI sistemi arasındaki farkı ortaya çıkarır.
Veri güvenliği ve hukuki göstergeler neden KPI sistemine dahil edilmeli?
AI sisteminin finansal getirisi yüksek olsa bile kişisel veri, güvenlik veya düzenleyici yükümlülüklerin ihlal edilmesi projenin kabul edilebilir olduğu anlamına gelmez.
KVKK'nın yapay zekâ alanındaki tavsiyeleri; hukuka uygunluk, ölçülülük, veri minimizasyonu, insan müdahalesi, ayrımcılığın önlenmesi ve veri güvenliği gibi unsurların yapay zekâ sistemlerinin yaşam döngüsünde dikkate alınmasını önerir [7]. Kurum ayrıca üretken yapay zekâ sistemlerinin kişisel veri işleme faaliyetlerini 6698 sayılı Kanun çerçevesinde değerlendiren ayrı bir rehber yayımlamıştır [8].
Bu nedenle kişisel veri işleyen sistemlerde örneğin:
- gereksiz kişisel veri gönderimi,
- yetkisiz erişim,
- saklama politikası ihlalleri,
- veri aktarım süreçleri,
- kişisel veri içeren model çıktıları
ayrı kontrol noktaları olarak değerlendirilebilir.
AB'de faaliyet gösteren veya AB pazarını ilgilendiren belirli sistemlerde AI Act kapsamı ayrıca değerlendirilmelidir. AI Act 1 Ağustos 2024'te yürürlüğe girmiş, kalan hükümlerin çoğu 2 Ağustos 2026 itibarıyla uygulanmaya başlamıştır. Bununla birlikte Bölüm III Kısım 1–3'teki temel yüksek risk yükümlülükleri, Madde 6(2)/Ek III kapsamındaki sistemler için 2 Aralık 2027'den; Madde 6(1)/Ek I kapsamındaki sistemler için 2 Ağustos 2028'den itibaren uygulanacaktır. Madde 6(5) için ayrıca özel takvim bulunmaktadır [9]. Yüksek riskli sistemler bakımından mevzuat; risk yönetimi, doğruluk, sağlamlık, siber güvenlik, kayıt, dokümantasyon ve insan gözetimi gibi gereklilikler öngörmektedir [10].
Dolayısıyla uyum göstergeleri bazı projelerde ikincil metrik değil, doğrudan go/no-go kriteri olabilir.
KPI dashboard nasıl tasarlanmalı?
Yönetim dashboard'unun onlarca teknik metriği göstermesi gerekmez.
| Alan | Yönetim sorusu | Örnek KPI |
|---|---|---|
| İş değeri | Süreç iyileşti mi? | İşlem süresi |
| Ekonomi | Yatırım karşılığını veriyor mu? | İşlem başına maliyet / ROI |
| Kalite | Sistem görevini doğru yapıyor mu? | Kabul edilebilir çıktı oranı |
| Risk | Kabul edilemez risk oluşuyor mu? | Kritik olay oranı |
Teknik ekip bunun altında daha ayrıntılı metrikleri izleyebilir.
Örneğin LLM tabanlı RAG sisteminde:
- retrieval precision,
- kaynak kapsama oranı,
- groundedness,
- latency,
- token kullanımı,
- API hata oranı
takip edilirken yönetim seviyesinde bunların iş sonucuna etkisi gösterilebilir.
Yapay zekâ projelerinde sık yapılan ölçüm hataları
Yalnızca model doğruluğunu ölçmek
Yüksek teknik doğruluk ekonomik değer anlamına gelmez.
Baseline oluşturmamak
Başlangıç durumu bilinmediğinde iyileşmenin büyüklüğü ölçülemez.
Kullanımı başarı kabul etmek
Çalışanların sistemi kullanması, sistemin verimlilik veya finansal sonuç oluşturduğunu kanıtlamaz.
Tasarruf edilen zamanı doğrudan para kabul etmek
Kazanılan zamanın gerçekten kapasiteye, maliyet azalmasına veya başka üretken faaliyetlere dönüşmesi gerekir.
Gizli maliyetleri dışarıda bırakmak
Entegrasyon, bakım, değerlendirme, insan kontrolü ve güvenlik maliyetleri hesaba katılmadığında ROI olduğundan yüksek görünebilir.
Çok fazla KPI seçmek
Ölçülebilecek her şeyi ölçmek, karar vermeyi kolaylaştırmayabilir.
KPI'nın temel görevi veri üretmek değil, karar vermeyi desteklemektir.
Riskleri finansal ROI'den ayırmak
Yüksek finansal getiri, kabul edilemez güvenlik veya hukuk riskini otomatik olarak meşru hale getirmez.
NIST'in AI RMF yaklaşımında ölçüm; performansın yanı sıra güvenilirlik, risk ve etkilerin değerlendirilmesini de içerir [1][2].
Yapay zekâ projesi ne zaman durdurulmalı?
Her pilotun üretime alınması gerekmez.
Örneğin aşağıdaki koşullardan biri gerçekleşiyorsa projenin yeniden tasarlanması veya durdurulması düşünülebilir:
- kritik hata oranı kabul sınırının üzerindeyse,
- ekonomik fayda toplam maliyeti karşılamıyorsa,
- kullanıcılar sistemi benimsemiyorsa,
- insan kontrolü ihtiyacı otomasyon faydasını ortadan kaldırıyorsa,
- güvenilir veri sağlanamıyorsa,
- kişisel veri veya güvenlik riskleri yeterince kontrol edilemiyorsa,
- performans gerçek kullanım koşullarında istikrarlı değilse,
- sistemin oluşturduğu fayda daha basit bir otomasyon yöntemiyle elde edilebiliyorsa.
Her problem yapay zekâ problemi değildir. Sabit kurallarla çözülebilecek deterministik bir süreçte klasik yazılım veya iş akışı otomasyonu daha ucuz, açıklanabilir ve sürdürülebilir olabilir.
AI projesi başarı kontrol listesi
- Çözülmek istenen iş problemi açıkça tanımlandı mı?
- AI kullanılmadan önceki baseline ölçüldü mü?
- Birincil iş KPI'ı belirlendi mi?
- Teknik kalite KPI'ları belirlendi mi?
- Kullanıcı benimsemesi ölçülüyor mu?
- Toplam sahip olma maliyeti hesaplandı mı?
- Finansal faydanın nasıl hesaplanacağı tanımlandı mı?
- Zaman tasarrufu ile gerçek maliyet tasarrufu ayrıştırıldı mı?
- Kritik hata ve risk eşikleri belirlendi mi?
- Kişisel veri ve güvenlik gereksinimleri değerlendirildi mi?
- İnsan denetiminin hangi durumlarda gerekli olduğu belirlendi mi?
- Pilot için başarı ve başarısızlık kriterleri önceden tanımlandı mı?
- Sonuçlar mümkün olduğunda mevcut süreç veya kontrol grubuyla karşılaştırılıyor mu?
- Model ve altyapı maliyetleri üretim hacminde tahmin edildi mi?
- Ölçekleme sonrasında performansın izlenmesi için süreç oluşturuldu mu?
Sonuç
Yapay zekâ projelerinde başarı, "model çalışıyor mu?" sorusundan çok daha geniş bir konudur.
Sağlıklı değerlendirme; iş sonuçlarını, teknik performansı, kullanıcı benimsemesini, toplam maliyeti ve riskleri aynı çerçevede ele almalıdır.
ROI önemli bir göstergedir ancak tek başına yeterli değildir. Benzer şekilde yüksek doğruluk, yüksek kullanım veya çalışanların zaman kazanması da tek başına projenin başarılı olduğunu göstermez.
En güvenilir yaklaşım; AI uygulamasından önce baseline oluşturmak, ölçülebilir hedefler ve kabul eşikleri belirlemek, pilot sonuçlarını mevcut süreçle karşılaştırmak ve ekonomik faydayı risk göstergeleriyle birlikte değerlendirmektir.
Bu yaklaşımın sonunda şirketin cevaplaması gereken temel soru oldukça nettir:
Bu yapay zekâ sistemi, oluşturduğu maliyet ve riskler hesaba katıldığında mevcut yönteme göre ölçülebilir ve sürdürülebilir bir iş değeri üretiyor mu?
Sık Sorulan Sorular
Yapay zekâ projesinin başarılı olduğu nasıl anlaşılır?
Başarı; önceden belirlenen iş KPI'ları, teknik performans, maliyet, kullanıcı benimsemesi ve risk göstergelerinin birlikte değerlendirilmesiyle anlaşılır. Yalnızca model doğruluğu yeterli değildir.
Yapay zekâ projelerinde hangi KPI'lar kullanılmalı?
KPI'lar kullanım senaryosuna göre değişir. İşlem süresi, hata oranı, görev başarı oranı, aktif kullanım, insan müdahalesi oranı, işlem başına maliyet ve kritik hata oranı sık kullanılabilecek kategorilere örnektir.
AI ROI nasıl hesaplanır?
Basitleştirilmiş olarak toplam finansal faydadan toplam yatırım maliyeti çıkarılır ve sonuç toplam yatırım maliyetine bölünür. Ancak entegrasyon, altyapı, bakım, insan denetimi ve uyum maliyetlerinin de hesaba katılması gerekir.
Çalışanların kazandığı zaman doğrudan finansal kazanç mıdır?
Her zaman değildir. Kazanılan zamanın ek kapasite, maliyet azalması veya başka ölçülebilir üretken faaliyetlere dönüşüp dönüşmediği incelenmelidir.
Bir AI pilotu ne kadar başarılı olursa üretime alınmalıdır?
Evrensel bir başarı oranı yoktur. Kabul seviyesi kullanım senaryosunun ekonomik değeri, hata maliyeti ve risk düzeyine göre pilot başlamadan önce belirlenmelidir.
AI projesinde baseline nedir?
Baseline, yapay zekâ uygulanmadan önce mevcut sürecin ölçülen performansıdır. AI sonrasındaki değişimin gerçekten iyileşme olup olmadığını değerlendirmek için referans noktası sağlar.
ROI pozitifse yapay zekâ projesi başarılı sayılır mı?
Mutlaka değil. Pozitif finansal getiriye rağmen güvenlik, veri koruma, kalite veya düzenleyici riskler kabul edilemez seviyede olabilir.
Her otomasyon projesinde yapay zekâ kullanılmalı mı?
Hayır. Problem sabit kurallar ve klasik otomasyonla güvenilir biçimde çözülebiliyorsa AI gereksiz maliyet ve belirsizlik oluşturabilir.
Kaynaklar
- National Institute of Standards and Technology (NIST) — Artificial Intelligence Risk Management Framework (AI RMF 1.0) — 26 Ocak 2023 — https://www.nist.gov/publications/artificial-intelligence-risk-management-framework-ai-rmf-10 — Erişim: 27 Eylül 2026 — Yapay zekâ risklerinin yaşam döngüsü boyunca yönetilmesi ve güvenilir AI sistemlerinin değerlendirilmesi için kullanılan temel çerçeveyi destekler.
- National Institute of Standards and Technology (NIST) — AI RMF Core – Measure — AI RMF 1.0 kapsamında — https://airc.nist.gov/airmf-resources/airmf/5-sec-core/ — Erişim: 27 Eylül 2026 — AI sistemlerinin nicel/nitel yöntemlerle ölçülmesi ve uygun metriklerin seçilmesiyle ilgili bölümleri destekler.
- Google Cloud — Evaluate and define your generative AI business use case — https://docs.cloud.google.com/docs/ai-ml/generative-ai/evaluate-define-generative-ai-use-case — Erişim: 27 Eylül 2026 — Ölçülebilir iş hedefleri ve AI kullanım senaryosu değerlendirmesini destekler.
- Microsoft — Monitor, measure, and report value — https://learn.microsoft.com/en-us/agents/center-of-excellence/measure-report-value — Erişim: 27 Eylül 2026 — Leading/lagging göstergelerin ve benimsenme, değer, yönetişim ve risk metriklerinin birlikte değerlendirilmesini destekler.
- OECD — OECD AI Principles — 2019, 2024'te güncellendi — https://www.oecd.org/en/topics/ai-principles.html — Erişim: 27 Eylül 2026 — Hesap verebilirlik, izlenebilirlik, güvenlik ve sistematik risk yönetimine ilişkin açıklamaları destekler.
- Google Cloud — Three-part framework to measure the impact of your AI use case — 11 Eylül 2025 — https://cloud.google.com/blog/topics/cost-management/measure-the-value-and-impact-of-your-ai — Erişim: 27 Eylül 2026 — AI yatırımlarında değer sürücülerinin iş sonuçlarına bağlanmasını destekler.
- Kişisel Verileri Koruma Kurumu (KVKK) — Yapay Zekâ Alanında Kişisel Verilerin Korunmasına Dair Tavsiyeler — 15 Eylül 2021 — https://kvkk.gov.tr/SharedFolderServer/CMSFiles/25a1162f-0e61-4a43-98d0-3e7d057ac31a.pdf — Erişim: 27 Eylül 2026 — Hukuka uygunluk, ölçülülük, temel haklar, insan müdahalesi ve veri güvenliğiyle ilgili değerlendirmeleri destekler.
- Kişisel Verileri Koruma Kurumu (KVKK) — Üretken Yapay Zekâ ve Kişisel Verilerin Korunması Rehberi (15 Soruda) — https://www.kvkk.gov.tr/Icerik/8547/uretken-yapay-zeka-ve-kisisel-verilerin-korunmasi-rehberi-15-soruda — Erişim: 27 Eylül 2026 — Üretken yapay zekâ yaşam döngüsündeki kişisel veri işleme faaliyetlerinin 6698 sayılı Kanun kapsamında değerlendirilmesini destekler.
- European Commission — AI Act – Regulatory Framework — https://digital-strategy.ec.europa.eu/en/policies/regulatory-framework-ai — Erişim: 27 Eylül 2026 — AI Act'in yürürlüğe giriş ve kademeli uygulama takvimine ilişkin bilgileri destekler.
- European Union / EUR-Lex — Regulation (EU) 2024/1689 – Artificial Intelligence Act — 13 Haziran 2024 — https://eur-lex.europa.eu/legal-content/EN/ALL/?uri=OJ%3AL_202401689 — Erişim: 27 Eylül 2026 — Yüksek riskli AI sistemleri için risk yönetimi, doğruluk, sağlamlık ve siber güvenlik gerekliliklerini destekler.
