Büyük dil modeli (LLM)
Diğer adları: LLM, Large Language Model, Dil modeli
Büyük dil modeli (LLM), çok büyük miktarda metinle eğitilerek bir metinde sıradaki kelimeyi tahmin etmeyi öğrenen ve bu sayede soru cevaplama, özetleme ve yazma gibi işleri yapabilen yapay zeka modelidir.
ChatGPT’nin arkasındaki GPT modelleri, Anthropic’in Claude modelleri ve Google’ın Gemini modelleri büyük dil modelidir. Bu modeller kitaplar, web sayfaları ve kod gibi kaynaklardan oluşan geniş veriyle eğitilir, ardından insan geri bildirimiyle sohbet etmeye ve talimat izlemeye uygun hale getirilir.
Model bilgisini nereden alır?
Bir dil modelinin cevabı iki kaynaktan gelebilir:
- Eğitim verisi: Model eğitildiği tarihe kadar gördüğü metinlerden öğrendiklerini kullanır. Bu bilginin bir kesim tarihi vardır, sonrasını bilmez.
- Anlık arama: Birçok asistan soruya cevap vermeden önce web’de arama yapar ve bulduğu sayfaları kullanır. Bu yönteme RAG denir.
Bir markanın yapay zeka cevaplarında nasıl göründüğü bu iki kaynağa bağlıdır. Arama yapılan cevaplarda sitenin yapay zeka botlarına açık olması da önemlidir.
Sınırları
Dil modelleri olasılığa dayanarak metin üretir. Bu yüzden akıcı ama yanlış cevaplar verebilir; buna halüsinasyon denir. Aynı soruya farklı zamanlarda farklı cevaplar da verebilirler. Yapay zeka görünürlüğünü tek bir denemeyle değil, aynı soruları tekrar tekrar sorarak ölçmek bu yüzden gerekir.
Örnek
Bir kullanıcı “Ankara’da endüstriyel kalıp üreten firmalar” diye sorduğunda model hem eğitim verisinden hatırladıklarını hem de o an bulduğu sayfaları birleştirerek bir liste oluşturur.