Makine öğrenmesi sınıflandırma modellerini değerlendirirken doğru metriği seçmek, modelin gerçek performansını anlamak için kritik öneme sahiptir. Accuracy her ne kadar yaygın kullanılsa da, özellikle dengesiz veri setlerinde yanıltıcı olabilir. Bu yazıda accuracy, precision, recall, F1 score ve AUC-ROC metriklerini karşılaştırarak hangi durumda hangi metriğin tercih edilmesi gerektiğini pratik örneklerle açıklıyoruz.
Accuracy: Ne Zaman Güvenilir?
Accuracy, doğru tahminlerin toplam tahminlere oranıdır: (TP + TN) / (TP + TN + FP + FN). Dengeli sınıf dağılımlarında (örneğin %50 pozitif, %50 negatif) accuracy iyi bir performans göstergesidir. Ancak dengesiz veri setlerinde, örneğin %95 negatif %5 pozitif içeren bir veride, tüm örnekleri negatif tahmin eden bir model %95 accuracy elde ederken aslında hiçbir pozitif örneği yakalayamaz. Bu nedenle accuracy tek başına yeterli değildir.
Precision ve Recall: İkili Analiz
Precision (kesinlik), pozitif olarak tahmin edilenlerin ne kadarının gerçekten pozitif olduğunu ölçer: TP / (TP + FP). Yanlış pozitifleri azaltmak istediğiniz durumlarda (örneğin spam filtreleme) precision önemlidir. Recall (duyarlılık / gerçek pozitif oranı), gerçek pozitiflerin ne kadarının doğru tahmin edildiğini gösterir: TP / (TP + FN). Yanlış negatifleri minimize etmek istediğinizde (örneğin kanser teşhisi) recall ön plandadır. Genellikle precision ve recall arasında bir trade-off vardır; birini artırmak diğerini azaltabilir.
F1 Score: Denge Metriği
F1 score, precision ve recall’un harmonik ortalamasıdır: 2 * (precision * recall) / (precision + recall). Tek bir sayıyla her iki metriği dengeler. Dengesiz veri setlerinde accuracy’den daha güvenilirdir, çünkü sınıf dağılımından etkilenmez. Özellikle iki metrik arasında bir denge kurmak istediğinizde tercih edilir. Ancak F1 score, yanlış pozitif ve yanlış negatif maliyetlerinin eşit olduğu varsayımına dayanır; eğer maliyetler farklıysa, precision veya recall’a ağırlık vermek daha uygun olabilir.
AUC-ROC: Genel Performans Ölçütü
AUC-ROC (Area Under the ROC Curve), modelin farklı eşik değerlerindeki genel performansını ölçer. ROC eğrisi, gerçek pozitif oranını (recall) yanlış pozitif oranına (FPR = FP / (FP + TN)) karşı çizer. AUC değeri 0.5 ile 1 arasında değişir; 0.5 rastgele tahmini, 1 ise mükemmel sınıflandırmayı ifade eder. AUC-ROC, sınıf dağılımından bağımsızdır ve modelin tüm eşik değerlerindeki sıralama kabiliyetini değerlendirir. Özellikle sınıf dağılımı dengesiz olsa bile güvenilir bir metrik olarak kabul edilir. Ancak çok büyük dengesizliklerde (örneğin %99.9 negatif) AUC-PR daha bilgilendirici olabilir.
Karşılaştırma Tablosu
| Metrik | Odak Noktası | Dengesiz Veride Güvenilirlik | Kullanım Senaryosu |
|---|---|---|---|
| Accuracy | Genel doğruluk | Düşük | Dengeli sınıflar, her hata eşit maliyetli |
| Precision | Yanlış pozitifleri azaltma | Orta | Spam filtreleme, dolandırıcılık tespiti (FP maliyeti yüksek) |
| Recall | Yanlış negatifleri azaltma | Orta | Tıbbi teşhis, kaçak tespiti (FN maliyeti yüksek) |
| F1 Score | Precision/Recall dengesi | Yüksek | Dengesiz veri, genel performans değerlendirmesi |
| AUC-ROC | Sıralama başarısı | Yüksek | Model karşılaştırması, eşik seçiminden bağımsız değerlendirme |
Hangi Metrik Ne Zaman Kullanılmalı? Pratik Öneriler
- Dengeli veri seti ve eşit hata maliyeti: Accuracy yeterlidir.
- Dengesiz veri ve tek bir metrik: F1 score tercih edin.
- Yanlış pozitif maliyeti yüksek: Precision’a odaklanın.
- Yanlış negatif maliyeti yüksek: Recall’a odaklanın.
- Genel model karşılaştırması: AUC-ROC kullanın, ancak çok dengesiz durumlarda AUC-PR’yi değerlendirin.
Metrik seçiminde veri seti dengesizliğinin yanı sıra iş bağlamı da belirleyicidir. Örneğin, L1 ve L2 regülarizasyon yöntemleri gibi, model doğrulama stratejileri de metrik performansını etkiler. Cross-validation yöntemleri ile metrikleri daha güvenilir şekilde değerlendirebilirsiniz. Ayrıca eksik veri yönetimi gibi ön işleme adımları da nihai metrik değerlerini doğrudan etkiler.
Sık Yapılan Hatalar ve Uyarılar
- Dengesiz veri setinde sadece accuracy’ye güvenmek yaygın bir hatadır. Her zaman precision, recall ve F1 score’a da bakın.
- Metrikleri seçerken iş maliyetlerini göz ardı etmeyin. Örneğin, bir hastalık teşhisinde yanlış negatifin maliyeti yanlış pozitiften çok daha yüksektir.
- AUC-ROC yüksek olsa bile, düşük recall değerleri gözden kaçabilir. ROC eğrisini görsel olarak inceleyin.
- Metrikleri eşik değerine bağlı olarak seçmek yerine, AUC gibi eşikten bağımsız metrikleri de kullanın.
Sonuç olarak, doğru metrik seçimi projenizin başarısını doğrudan etkiler. Veri seti özelliklerini ve iş gereksinimlerini dikkate alarak, yukarıdaki rehber doğrultusunda metriklerinizi belirleyin. Unutmayın, hiçbir metrik tek başına mükemmel değildir; birden fazla metriği bir arada değerlendirmek en sağlıklı yaklaşımdır.
Sık Sorulan Sorular
Dengesiz veri setlerinde neden accuracy yanıltıcıdır?
Accuracy, tüm sınıfları eşit önemde ele alır; dengesiz veride çoğunluk sınıfı yüksek accuracy sağlarken azınlık sınıfı tamamen göz ardı edilebilir. Bu nedenle dengesiz durumlarda F1 score veya AUC-ROC gibi metrikler daha güvenilirdir.
Precision ve recall arasında nasıl denge kurulur?
F1 score, precision ve recall'un harmonik ortalamasıdır ve bu iki metriği dengeler. Ancak iş gereksinimlerine göre (örneğin yanlış pozitif maliyeti yüksekse precision'a ağırlık verilebilir) ağırlıklı F-beta score da kullanılabilir.
AUC-ROC değeri 0.8 ne anlama gelir?
AUC-ROC 0.8, modelin rastgele tahminden (%50) daha iyi olduğunu ve sınıfları ayırt etme kabiliyetinin yüksek olduğunu gösterir. Genel olarak 0.8-0.9 arası iyi, 0.9+ mükemmel kabul edilir.
Birden fazla metrik kullanırken hangi sırayla karar vermeliyim?
Öncelikle veri seti dengesizliğini kontrol edin, ardından iş maliyetlerini belirleyin. Genel bir değerlendirme için F1 score ve AUC-ROC'u birlikte kullanın. Gerekirse precision ve recall'u ayrı ayrı inceleyin.






