LLM (Büyük Dil Modeli) Nedir, Nasıl Çalışır?
LLM, çok büyük metin kümeleriyle eğitilip metin üreten yapay zekâ modelidir. Token'ı, eğitimi, GPU ihtiyacını, sınırlarını ve güvenlik risklerini anlattık.

Kısa cevap: LLM (large language model, büyük dil modeli), çok büyük metin kümeleriyle önceden eğitilmiş, metni anlayıp üretebilen bir derin öğrenme modelidir. Temelde bir metnin devamında hangi token'ın (kelime ya da kelime parçası) geleceğini tahmin eder; bu tahmini art arda yaparak cevap, özet, çeviri ya da kod üretir. Bugünkü LLM'lerin temelinde 2017'de yayımlanan Transformer mimarisi var. Güçlü ama yanılmaz değil: kendinden emin biçimde yanlış bilgi üretebilir ve eğitim verisinin bittiği tarihten sonrasını bilmez.
LLM nedir?
AWS'nin tanımıyla LLM'ler, çok büyük miktarda veriyle önceden eğitilmiş, çok büyük derin öğrenme modelleridir. "Büyük" sözcüğü parametre sayısını anlatır: ağırlıklar, sapmalar (bias) ve gömmeler (embedding), yani modelin eğitimde ayarlanan sayısal değerleri. Örneğin OpenAI'ın 2020'de yayımladığı makaledeki GPT-3 modelinin 175 milyar parametresi var.
LLM, yapay zekânın dil üzerine uzmanlaşmış bir kolu: makine öğrenmesinin içinde derin öğrenme, onun içinde de dile odaklanan bu büyük modeller yer alır. Sözlüğümüzdeki LLM maddesinin altını çizdiği gibi, kurumsal kullanımda asıl soru modelin yeteneğinden çok hangi verinin nereye gittiği.
Transformer: LLM'lerin mimarisi
Bugünkü LLM'lerin mimarisi, Vaswani ve arkadaşlarının 2017'de yayımladığı "Attention Is All You Need" makalesine dayanıyor. Makale, tekrarlı (recurrent) ve evrişimli (convolutional) katmanları bırakıp yalnızca dikkat (attention) mekanizmasına dayanan bir mimari önerdi: Transformer. AWS'nin anlatımıyla bu yapı, metinden anlam çıkarır ve kelimelerle ifadeler arasındaki ilişkileri kavrar.
Makalenin kritik bulgularından biri hızdı: Transformer daha paralelleştirilebilirdi ve eğitimi belirgin biçimde daha kısa sürüyordu. Paralel yürütülebilen bir mimari, binlerce iş parçacığını aynı anda çalıştıran GPU'ya doğrudan oturuyor.
Token, ön eğitim, ince ayar ve çıkarım
- Token: Model metni token denen birimlere bölerek işler. Microsoft Learn'e göre token bir kelime, bir karakter dizisi ya da kelime ile noktalamanın birleşimi olabilir; bölme yöntemi modelden modele değişir. Giriş ve çıkış token'larının toplam sınırına bağlam penceresi (context window) denir ve her isteğin maliyeti token sayısına bağlıdır.
- Ön eğitim (pre-training): Model, büyük bir metin kümesinde önceki token'lardan bir sonrakini doğru tahmin edene kadar parametrelerini tekrar tekrar ayarlar.
- İnce ayar (fine-tuning): Önceden eğitilmiş temel model, görece küçük ve göreve özel bir veri kümesiyle yeniden eğitilerek belirli bir işe uyarlanır.
- Çıkarım (inference): Eğitilmiş modelin yeni bir girdiye cevap üretmesi; kullanıcının her sorusu bir çıkarım isteği.
Token sayısı dile göre de değişiyor. NeurIPS 2023'te yayımlanan bir araştırmaya göre aynı metnin farklı dillerdeki hâlleri çok farklı sayıda token'a bölünebiliyor ve fark bazı durumlarda 15 kata çıkıyor. Türkçe içerikle çalışacaksanız maliyeti ve bağlam penceresini kendi metinlerinizle ölçün.
LLM neden bu kadar çok GPU ister?
Cevap bellekte. NVIDIA'nın hesabına göre 7 milyar parametreli bir model 16 bit hassasiyetle yüklendiğinde yalnızca ağırlıkları için yaklaşık 14 GB bellek ister. Aynı hesapla 70 milyar parametreli bir modelin ağırlıkları 140 GB eder ve 80 GB belleği olan bir H100 GPU'ya sığmaz. Çıkarım sırasında ağırlıklara ek olarak KV cache adlı bir bellek alanı da gerekir; NVIDIA'ya göre bu alan, aynı anda işlenen istek sayısıyla ve metin uzunluğuyla doğrusal büyür.
Çözümlerden biri, modeli birden fazla GPU'ya dağıtıp GPU başına düşen bellek yükünü azaltmak. Donanımı satın almak ile kiralamak arasındaki kararı GPU satın almak mı kiralamak mı yazımızda ele aldık.
LLM'lerin sınırları
- Halüsinasyon: NIST, üretken yapay zekâ profilinde (AI 600-1) bu sorunu "konfabulasyon" diye adlandırıyor: kendinden emin biçimde sunulan ama hatalı ya da yanlış içerik üretilmesi. NIST'e göre bu, modelin eğitim verisinin istatistiksel dağılımına yaklaşan çıktılar üretmesinin doğal bir sonucu.
- Güncel bilgi eksikliği: AWS'nin RAG sayfasındaki ifadeyle eğitim verisi durağandır ve modelin bilgisine bir kesim tarihi koyar. Güncel cevap beklenen bir soruya model eskimiş ya da genel bir bilgiyle karşılık verebilir.
- Maliyet: Her istek token tükettiği için fatura kullanımla büyür; çıkarım maliyetini yapay zekâ FinOps yazımızda ele aldık.
Kurumsal kullanım: RAG, açık model ve veri gizliliği
Kurumsal kullanımda model, eğitim verisinde olmayan bilgiyle de cevap verebilmeli: iç politikalar, ürün belgeleri, sözleşmeler. Bunun yöntemlerinden biri RAG (retrieval-augmented generation). AWS'nin tarifiyle RAG'de model, cevap üretmeden önce eğitim verisinin dışındaki yetkili bir bilgi kaynağına başvurur; böylece yeniden eğitilmeden kurumun iç bilgisine erişir ve kaynağını gösterebilir.
İkinci karar, modelin nerede çalışacağı:
- API olarak kullanılan model: Altyapı kurmadan hızlı başlanır; ama istemler ve içlerindeki veri sağlayıcının sistemine gider.
- Kendi altyapınızda çalışan açık ağırlıklı model: Veri sizde kalır; ama GPU kapasitesi, model sürümleri, değerlendirme ve nöbet de sizin işiniz olur.
Ayrımı modelin açık ya da kapalı olması değil, verinin sınıfı belirler; bunu egemen yapay zekâ yazımızda anlattık. İstemlere kişisel veri giriyorsa modelin hangi ülkede çalıştığı da önem kazanır. Bunun KVKK açısından anlamını KVKK ve yurt dışına aktarım yazımızda, kurum içi yönetişimi yapay zekâ yönetişimi yazımızda ele aldık.
Güvenlik riskleri: OWASP LLM Top 10
OWASP GenAI Security Project, LLM uygulamalarındaki en kritik güvenlik risklerini topluluk katkısıyla hazırlanan Top 10 for LLM Applications listesinde topluyor. Güncel sürüm 2026 tarihli; ilk üç sırada şunlar var:
- Prompt injection (LLM01): Kullanıcı girdisi, modelin okuduğu bir belge ya da araç çıktısı gibi herhangi bir girdinin modelin davranışını geliştiricinin öngörmediği biçimde değiştirmesi. Talimat, kullanıcının ne yazdığı ne de gördüğü bir içeriğe gizlenmiş olabilir.
- Hassas bilgi ifşası (LLM02): LLM'e bağlı bir sistemin gizli ya da düzenlemeye tabi bilgileri açığa çıkarması.
- Aşırı yetki (Excessive Agency, LLM03): Araç çağırabilen bir LLM'e gereğinden fazla işlev, izin ya da özerklik verilmesi. 2025 listesinde altıncıydı; listeyi hazırlayan proje ekibi bu yükselişi listedeki en önemli değişiklik olarak niteliyor.
Listede kontrolsüz tüketim (LLM06) ve halüsinasyonu da kapsayan yanlış bilgi (LLM07) de var. Ajanlara yetkinin hangi sırayla devredileceğini BT operasyonlarında yapay zekâ ajanları yazımızda, bu katmanın tasarımını AI stack tasarımı ve mühendisliği sayfamızda anlattık.
Sık sorulan sorular
LLM ne demek? Large language model, yani büyük dil modeli demek: çok büyük metin kümeleriyle eğitilmiş, metni anlayıp üretebilen yapay zekâ modeli.
LLM ne işe yarar? Metin yazma, bilgi tabanlarından soru cevaplama, metin sınıflandırma ve kod üretme gibi dille ilgili işlerde kullanılır.
LLM ile yapay zekâ arasındaki fark nedir? Yapay zekâ en geniş kavram; LLM ise onun içinde, dil üzerine uzmanlaşmış bir derin öğrenme modeli türü. Her LLM bir yapay zekâ sistemidir, ama her yapay zekâ sistemi LLM değildir.
LLM nasıl eğitilir? Önce çok büyük bir metin kümesi üzerinde, bir sonraki token'ı tahmin edecek biçimde ön eğitimden geçer. Ardından belirli görevler için daha küçük, göreve özel veriyle ince ayar yapılabilir.
LLM halüsinasyonu nedir? Modelin kendinden emin biçimde ama hatalı ya da yanlış bilgi üretmesi. NIST bu riski "konfabulasyon" olarak adlandırıyor.
RAG nedir? Retrieval-augmented generation, yani modelin cevap üretmeden önce kurum belgeleri gibi dış bir bilgi kaynağına başvurması. Model yeniden eğitilmeden güncel ve kuruma özel bilgiyle cevap verebilir.
Kaynaklar
- AWS, What is LLM?: LLM tanımı, parametreler, eğitim ve kullanım alanları
- Vaswani ve diğerleri, Attention Is All You Need: Transformer mimarisi (arXiv, 12 Haziran 2017)
- Brown ve diğerleri, Language Models are Few-Shot Learners: GPT-3'ün parametre sayısı (arXiv, 28 Mayıs 2020)
- Microsoft Learn, Understanding tokens: token, bağlam penceresi ve maliyet
- Petrov ve diğerleri, Language Model Tokenizers Introduce Unfairness Between Languages: dillere göre token farkı (NeurIPS 2023)
- NVIDIA, Mastering LLM Techniques: Inference Optimization: ağırlıkların bellek ihtiyacı ve KV cache (17 Kasım 2023)
- NVIDIA, H100 GPU: H100'ün bellek kapasitesi
- NIST, AI 600-1 Generative Artificial Intelligence Profile: konfabulasyon tanımı (Temmuz 2024)
- AWS, What is RAG?: eğitim verisinin kesim tarihi ve RAG
- OWASP GenAI Security Project, Top 10 for LLM Applications 2026: LLM uygulamalarında güvenlik riskleri
- Bu katmanı nasıl işlettiğimiz: AI stack tasarımı ve mühendisliği