BaşlaEğitim ModülleriKullanım ÖrnekleriSlayt Sunumu
Modül 13 · Uzman

Güvenlik, Halüsinasyon, Politika Katmanları ve Güvenilirlik

Modelin neden bazen yanlış cevap verebildiğini, güvenlik katmanlarının nasıl çalıştığını ve cevapların nasıl doğrulanması gerektiğini öğren.

SAFE
Veri filtresiHizalamaSınıflandırıcıAraç izniÇıktı kontrolü
Risk skoru0%
Güvenilirlik0%

Bu modülde ne öğreneceksin?

  • Halüsinasyon nedenlerini anlamak
  • Güvenlik katmanlarının eğitimden çıktı kontrolüne kadar uzandığını görmek
  • Kritik alanlarda doğrulama alışkanlığı kazanmak
13.1

Halüsinasyon

Model cevapları doğrudan bir doğruluk veritabanından çekmez; bağlama göre olası görünen token dizileri üretir. Bu yüzden eksik bilgi, belirsiz istek, güncel olmayan veri veya yanlış bağlam durumunda emin görünen ama yanlış cevap üretebilir.

13.2

Güvenlik katmanları

Modern asistanlarda güvenlik tek bir filtre değildir. Eğitim verisi filtreleme, SFT, RLHF veya benzeri hizalama, güvenlik sınıflandırıcıları, araç izinleri, hassas veri kontrolleri ve çıktı sonrası değerlendirme gibi katmanlar birlikte çalışır.

13.3

Jailbreak ve direnç

Kötü niyetli kullanıcılar sistemi yönergeleri yok saymaya, gizli bilgileri açığa çıkarmaya veya zararlı talimat üretmeye zorlayabilir. Bu nedenle sistemler yalnızca kullanıcı metnini değil, talebin amacını ve olası etkisini de değerlendirir.

13.4

Güvenilir kullanım

Tıbbi, hukuki, finansal, güvenlik, kod, güncel haber veya akademik kaynak gerektiren konularda cevap doğrulanmalıdır. AI iyi bir yardımcıdır; fakat kritik karar sistemlerinde tek başına otorite gibi kullanılmamalıdır.

Kısa teknik notlar

Not

Halüsinasyon, tutarlı görünen cevabın doğru olmamasıdır.

Not

Güvenlik katmanları hem eğitimde hem ürün çalışırken devrededir.

Not

Kaynaklı ve doğrulanabilir cevap, güvenilirliği artırır.

Derinleşme

Sınırlar ve savunma katmanları

01

Halüsinasyon, modelin yanlış bilgiyi güvenli ve akıcı bir dille üretmesidir. Bunun nedeni modelin doğruluk veritabanı değil, olasılıksal üretim sistemi olmasıdır.

Uygulama

Verimli kullanım bağlantısı

Güvenilir cevap için modelin akıcılığına değil, kaynağa, bağlama ve doğrulanabilirliğe bakılmalıdır.

02

Prompt injection, dış kaynak içindeki kötü niyetli talimatların sistem davranışını değiştirmeye çalışmasıdır. Güvenli sistemler veri ile komutu ayırır.

03

Güvenlik; eğitim filtreleri, hizalama, sınıflandırıcılar, araç izinleri, kaynak doğrulama ve çıktı kontrolü gibi birden fazla katmandan oluşur.

Anlatım akışı

Bu konuyu eğitim sırasında nasıl kurmalısın?

01

Halüsinasyonu modelin olası ama yanlış metin üretme riski olarak anlat.

02

Prompt injection riskini dış kaynak içindeki gizli talimat örneğiyle açıkla.

03

Güvenlik katmanlarının tek bir filtre değil; eğitim, sınıflandırma, politika ve araç izni birleşimi olduğunu belirt.

Terim kutusu

Bu modülde geçen teknik terimler

Bu bölümde geçen teknik kavramların kısa ve doğrudan açıklamaları.

Halüsinasyon

Modelin güvenilir görünen fakat yanlış veya kaynaksız cevap üretmesi durumudur.

Moderation

İstek veya çıktının güvenlik açısından sınıflandırılması ve gerektiğinde sınırlandırılmasıdır.

Policy Classifier

İçeriğin risk kategorisini belirleyen güvenlik sınıflandırıcısıdır.

Prompt Injection

Güvenilmez metnin modele sahte talimat gibi okutulması riskidir.

Privacy

Kişisel veya hassas bilgilerin korunması ilkesidir.

Refusal

Modelin güvenli olmadığı için bir isteği yerine getirmeyi reddetmesidir.