Chain-of-Thought (CoT) prompting, büyük dil modellerinin (LLM) karmaşık mantıksal veya matematiksel problemleri çözmek için ara adımlar üretmesini sağlayan bir tekniktir. Standart promptlardan farklı olarak modelden doğrudan yanıt vermesini değil, önce akıl yürütme sürecini açıklamasını ister. Bu yöntem, özellikle çok adımlı problem çözme, matematiksel hesaplamalar ve mantıksal çıkarım gerektiren görevlerde doğruluğu önemli ölçüde artırır.
Chain-of-Thought Prompting Nedir?
Chain-of-Thought prompting, bir LLM'ye sorunu çözerken izlediği düşünce zincirini (adımları) sıralaması talimatını veren bir prompt mühendisliği tekniğidir. Örneğin, "Bir çiftlikte 15 koyun ve 7 tavuk var. Toplam ayak sayısı kaçtır?" sorusuna standart promptla model doğrudan "60" gibi bir sayı verebilirken, CoT promptu şöyle olabilir: "Adım adım düşünelim. Her koyunun 4 ayağı var, 15 koyun için 15*4=60. Her tavuğun 2 ayağı var, 7 tavuk için 7*2=14. Toplam 60+14=74 ayak." Böylece model ara hesaplamaları görünür kılar ve hata yapma olasılığı azalır.
CoT, temel olarak iki şekilde uygulanır: birkaç örnekle (few-shot CoT) veya sıfır örnekle (zero-shot CoT). Few-shot CoT'de promptta bir veya daha fazla çözüm örneği verilir, zero-shot CoT'de ise sadece "Adım adım düşünelim" gibi bir yönlendirme yeterlidir.
Chain-of-Thought Nasıl Çalışır?
CoT, LLM'lerin doğal dil üretme yeteneğini kullanarak bir tür "iç monolog" oluşturmalarını sağlar. Model, verilen prompta yanıt olarak önce ara mantıksal adımları sıralar, ardından nihai cevabı üretir. Bu süreç, modelin dikkatini problemin farklı yönlerine odaklamasına ve hatalı erken genellemelerden kaçınmasına yardımcı olur. Araştırmalar, CoT'nin özellikle matematik (GSM8K, MATH), mantık (BIG-Bench) ve sembolik akıl yürütme gibi alanlarda doğruluğu %10-30 oranında artırabildiğini göstermektedir.
CoT Ne Zaman Kullanılmalı?
Chain-of-Thought prompting, aşağıdaki durumlarda standart prompting'e göre daha etkilidir:
- Karmaşık mantıksal veya matematiksel problemler: Çok adımlı hesaplamalar, cebirsel ifadeler, mantık bulmacaları.
- Adım adım analiz gerektiren görevler: Hukuki yorumlama, tıbbi tanı, kod hata ayıklama.
- Doğruluğun kritik olduğu uygulamalar: Finansal hesaplamalar, bilimsel veri analizi.
- Modelin kararını açıklaması gereken senaryolar: Denetlenebilir yapay zeka sistemleri.
Ancak CoT her zaman en iyi seçenek değildir. Basit, tek adımlı sorular için (örneğin, "Türkiye'nin başkenti neresidir?") CoT ekstra token tüketimi ve gecikme yaratırken doğrulukta anlamlı bir artış sağlamaz. Ayrıca modelin halüsinasyon görme riski, CoT ile daha uzun çıktı üretildiği için artabilir; bu nedenle güvenilirlik testleri önemlidir.
Chain-of-Thought ile Tree-of-Thought Arasındaki Fark Nedir?
Tree-of-Thought (ToT), CoT'nin bir uzantısıdır. CoT tek bir düşünce zinciri üretirken, ToT birden çok alternatif akıl yürütme yolunu keşfeder ve en umut verici olanı seçer. ToT, daha karmaşık ve keşif gerektiren problemlerde (örneğin, bulmaca çözme, stratejik planlama) daha başarılıdır, ancak hesaplama maliyeti daha yüksektir. CoT, çoğu pratik uygulama için yeterli ve daha hızlıdır.
CoT'yi Uygularken Dikkat Edilmesi Gerekenler
CoT promptları yazarken aşağıdaki noktalara özen gösterilmelidir:
- Net ve tutarlı adımlar: Her adım mantıksal bir sıra izlemeli ve sonraki adıma geçmeden önce tamamlanmalıdır.
- Örneklerin doğruluğu: Few-shot CoT'de verilen örneklerin kendisi hatasız olmalıdır; aksi halde model hatalı kalıpları öğrenir.
- Uzunluk kontrolü: Gereksiz ayrıntı token limitini zorlayabilir; sadece gerekli adımları ekleyin.
- Model seçimi: CoT, daha büyük modellerde (örneğin GPT-4, Claude 3) daha iyi çalışır; küçük modeller zinciri sürdürmekte zorlanabilir. OpenAI API vs Anthropic Claude API karşılaştırmasında, her iki API de CoT'yi destekler, ancak Claude 3'ün uzun bağlam işleme yeteneği avantaj sağlayabilir.
CoT'yi denemeden önce, Fine-Tuning vs RAG kararında olduğu gibi, problemin doğasına göre prompting, fine-tuning veya RAG arasında seçim yapmak gerekebilir. CoT, genellikle herhangi bir ek eğitim gerektirmediği için hızlı bir çözüm sunar.
CoT Performansını Değerlendirme
CoT'nin etkinliğini ölçmek için standart metrikler kullanılabilir. Örneğin, bir sınıflandırma görevinde doğruluk, kesinlik, hatırlama ve F1 skoru gibi metriklerle karşılaştırma yapılabilir. Sınıflandırma Metrikleri yazısında bu metriklerin ne zaman kullanılacağı detaylandırılmıştır. CoT'yi değerlendirirken, çıktının tamamının (zincir + cevap) doğruluğu yanında, sadece nihai cevabın doğruluğu da ölçülebilir. Ayrıca zincirin mantıksal tutarlılığı insan değerlendiricilerle kontrol edilmelidir.
| Yöntem | Doğruluk (GSM8K) | Token Kullanımı | Gecikme | Karmaşık Problemlerde Uygunluk |
|---|---|---|---|---|
| Standart Prompt | ~%58 | Düşük | Düşük | Düşük |
| Zero-shot CoT | ~%71 | Orta | Orta | Orta |
| Few-shot CoT | ~%78 | Yüksek | Yüksek | Yüksek |
Sık Yapılan Hatalar ve Çözümleri
CoT kullanırken karşılaşılan yaygın hatalar şunlardır:
- Zincirin yanlış yönlendirilmesi: Model bir adımda hata yaparsa, sonraki adımlar da hatalı olur. Çözüm: adımları daha küçük ve tekil parçalara bölün.
- Çok uzun zincirler: Token limitini aşma. Çözüm: sadece kritik adımları dahil edin; gereksiz açıklamaları kaldırın.
- Örneklerdeki önyargı: Few-shot örneklerindeki gizli önyargılar modele geçebilir. Çözüm: örnekleri çeşitlendirin ve tarafsız olmasına dikkat edin.
Sonuç olarak, Chain-of-Thought prompting, özellikle akıl yürütme gerektiren görevler için güçlü ve uygulaması kolay bir tekniktir. Doğru kullanıldığında LLM'lerin performansını önemli ölçüde artırabilir. Ancak her problem için en uygun yöntem farklıdır; bu nedenle OpenAI API vs Anthropic Claude API karşılaştırmasında da belirtildiği gibi, projenizin ihtiyaçlarına göre doğru API'yi ve prompting stratejisini seçmek kritiktir.
Sık Sorulan Sorular
Chain-of-Thought prompting ile standart prompting arasındaki temel fark nedir?
Standart prompting, modelden doğrudan cevap vermesini isterken, CoT modelden önce adım adım akıl yürütmesini ve ara adımları sıralamasını talep eder. Bu, özellikle çok adımlı problemlerde doğruluğu artırır.
Zero-shot CoT ile few-shot CoT arasında ne fark var?
Zero-shot CoT, prompta sadece 'Adım adım düşünelim' gibi bir yönlendirme ekler. Few-shot CoT ise bir veya daha fazla çözüm örneği içerir; bu örnekler modelin doğru akıl yürütme kalıbını öğrenmesine yardımcı olur.
Chain-of-Thought her tür soru için uygun mudur?
Hayır. Basit, tek adımlı sorular için CoT gereksiz token tüketimi ve gecikme yaratır, doğrulukta da anlamlı bir artış sağlamaz. Karmaşık mantıksal ve matematiksel problemler için idealdir.
CoT prompting hangi modellerde daha etkilidir?
CoT, genellikle 70B+ parametreli büyük modellerde (GPT-4, Claude 3, PaLM 2) daha başarılıdır. Küçük modeller zinciri sürdürmekte zorlanabilir veya mantıksal tutarlılık sağlayamayabilir.
CoT ile Tree-of-Thought (ToT) arasındaki fark nedir?
CoT tek bir düşünce zinciri üretirken, ToT birden fazla alternatif zinciri keşfeder ve en iyisini seçer. ToT, daha karmaşık keşif gerektiren problemlerde (örneğin, bulmaca çözme) daha etkilidir, ancak hesaplama maliyeti yüksektir.






