Bu modülde ne öğreneceksin?
- Self-attention formülünü sezgisel düzeyde anlamak
- Multi-head attention ile farklı ilişki türlerinin nasıl yakalandığını görmek
- KV cache kavramının üretim hızına etkisini kavramak
Transformer mantığı
Transformer, her tokenın diğer tokenlarla ilişkisini aynı anda hesaplayabilen bir mimaridir. Bu sayede uzun cümlede zamirin neye döndüğü, kodda değişkenin nerede tanımlandığı veya kullanıcının “tablo halinde ver” talimatının cevabın hangi bölümünü etkileyeceği takip edilebilir.
Self-attention
Self-attention her token için “Bu bağlamda hangi tokenlara ne kadar dikkat etmeliyim?” sorusuna cevap üretir. Query, key ve value temsilleri üzerinden ağırlıklar hesaplanır. Yüksek ağırlık alan tokenlar, mevcut tokenın yeni temsilinde daha etkili olur.
Multi-head attention
Tek bir dikkat başlığı yeterli değildir. Bir başlık özne-yüklem ilişkisini izlerken, diğeri tarihleri, bir diğeri kod değişkenlerini, bir başkası çıktı formatını takip edebilir. Multi-head attention, metni aynı anda farklı açılardan okuma yeteneği verir.
KV cache
Cevap üretilirken model her yeni token için önceki tokenlara bakar. Önceden hesaplanan key/value temsillerini saklamak, tekrar tekrar aynı hesapların yapılmasını azaltır. Bu teknik özellikle uzun cevaplarda gecikmeyi düşürmek için önemlidir.
Kısa teknik notlar
Attention, bağlam ilişkilerinin ağırlıklı haritasıdır.
Multi-head yapı, farklı ilişki türlerini paralel takip eder.
KV cache, üretilmiş bağlam için bazı hesapları yeniden yapmamak adına kullanılır.
Attention ve KV cache
Self-attention, her tokenın diğer tokenlarla ilişkisini ağırlıklandırır. Bu mekanizma sayesinde model bir zamirin hangi nesneye döndüğünü veya kod bloğunda değişkenin nerede kullanıldığını takip edebilir.
Verimli kullanım bağlantısı
Attention mantığını anlatırken “hangi token hangi bilgiye bakıyor?” sorusunu merkeze almak konuyu sadeleştirir.
Multi-head attention, aynı metni farklı açılardan okuyabilmeyi sağlar. Bir başlık dil ilişkilerine, başka bir başlık format talimatına, başka bir başlık teknik bağımlılıklara odaklanabilir.
KV cache inference sırasında önceki key/value hesaplarını saklayarak uzun cevap üretiminde tekrar hesaplamayı azaltır. Bu, özellikle ilk tokendan sonraki akışın daha stabil hissedilmesini sağlar.
Bu konuyu eğitim sırasında nasıl kurmalısın?
Self-attention’ı “hangi parçaya ne kadar bakılmalı?” sorusu üzerinden anlat.
Multi-head attention’ın aynı cümleyi farklı ilişki türleriyle okumasını örneklendir.
KV cache’in üretim sırasında tekrar hesaplamayı azaltarak gecikmeyi düşürebildiğini açıkla.
Bu modülde geçen teknik terimler
Bu bölümde geçen teknik kavramların kısa ve doğrudan açıklamaları.
Transformer
Attention mekanizmasını temel alan, tokenlar arasındaki ilişkileri paralel biçimde işleyen model mimarisidir.
Self-Attention
Bir tokenın aynı bağlamdaki diğer tokenlara ne kadar dikkat etmesi gerektiğini hesaplayan mekanizmadır.
Query / Key / Value
Attention hesabında kullanılan üç temsil türüdür; Query soru, Key eşleşme, Value taşınacak bilgi gibi düşünülebilir.
Multi-Head Attention
Aynı metni birden fazla attention başlığıyla farklı ilişkiler açısından okuma yöntemidir.
Feed-Forward Network
Attention sonrası her token temsilini ayrı ayrı dönüştüren sinir ağı katmanıdır.
Layer Normalization
Katmanlar arasında değerleri dengede tutarak üretimi daha kararlı hale getiren işlemdir.