Fundamental Research in Large Language Models

Panduan belajar dari slide Minggu 1 (Rifki Afina Putri, UGM). Setiap bagian punya penjelasan sederhana, demo interaktif, dan kotak kritis yang menunjukkan kelemahan atau perdebatan di dunia riset.

0. Peta besar: Input → Model → Output

Seluruh slide diatur dengan satu pipeline. Hafalkan ini dulu, sisanya tinggal mengisi.

BagianPertanyaan risetTopik di slide
InputBagaimana teks diubah jadi angka yang bisa diolah?Fitur manual vs deep learning, Word2Vec, GloVe, FastText, contextualized embedding
ModelBagaimana model dilatih dan seberapa besar?Pretraining & fine-tuning (BERT), scaling laws, in-context learning, RLHF
OutputBagaimana kita tahu hasilnya bagus?Closed vs open-ended, BLEU/ROUGE, BERTScore, manusia, Chatbot Arena, LLM-as-judge
Kritis: Pipeline tiga kotak ini adalah penyederhanaan. Di praktik, ketiganya saling memengaruhi. Misalnya, cara kita mengevaluasi (output) ikut menentukan model mana yang dianggap "bagus" lalu dikembangkan (model).

1. Language Model (LM)

1.1 Apa itu LM?

LM adalah model machine learning yang memprediksi kata berikutnya. Ia tidak memberi satu jawaban, tetapi distribusi probabilitas untuk semua kemungkinan kata.

Bayangkan keyboard HP yang menyarankan 3 kata di atas papan ketik. Itu adalah LM kecil.
Demo: "The light was ___" (angka dari slide). Atur top-k, lalu coba ambil sampel.

Klik tombol untuk menghasilkan kata.

Perhatikan: "on" (0,45) dan "off" (0,44) hampir sama. Jika top-k = 1, model selalu memilih "on" (deterministik). Jika k lebih besar, hasil bisa berbeda tiap kali. Itulah sebabnya ChatGPT bisa memberi jawaban berbeda untuk pertanyaan yang sama.

1.2 Definisi formal

1.3 Aplikasi

Autocomplete, autocorrect, terjemahan mesin, code completion (Copilot), dan chatbot (ChatGPT, Gemini, Claude). Semuanya adalah variasi dari "prediksi token berikutnya".

1.4 Evolusi LM

EraJenisContohKemampuan
1990-anStatistical LMn-gramMembantu tugas spesifik
2013Neural LMWord2VecFitur umum (task-agnostic) untuk tugas NLP tipikal
2018Pre-trained LMELMo, BERT, GPT-1/2Pretraining + fine-tuning; dipindah ke banyak tugas
2020LLMGPT-3/4, ChatGPT, ClaudePemecah tugas umum lewat prompt
Kritis: (1) Memprediksi kata berikutnya terdengar sederhana, tetapi tetap memerlukan banyak pengetahuan agar akurat. Namun apakah itu berarti model "memahami"? Ini masih diperdebatkan (kritik "stochastic parrot" vs pandangan bahwa model membangun representasi dunia). (2) Tahun di tabel adalah perkiraan; perubahan antar era bersifat bertahap, bukan lompatan tiba-tiba. (3) Model tidak mengecek kebenaran, hanya kelayakan statistik. Ini akar masalah halusinasi.

2. Input: representasi fitur

Komputer hanya mengerti angka. Pertanyaannya: bagaimana mengubah teks jadi angka yang mengandung makna?

2.1 Tradisional vs deep learning

ML klasikDeep learning
FiturDirancang manual oleh manusia (feature extraction)Dipelajari otomatis oleh jaringan saraf
Pipeline NLPDeteksi bahasa → tokenisasi → stemming → stopwords → ekstraksi fitur → modelingPre-processing → embedding → neural network → output
KekuranganButuh pakar, tiap bahasa/tugas dibuat ulangButuh data dan komputasi besar, sulit ditafsirkan
Kritis: "Otomatis" tidak berarti bebas keputusan manusia. Pilihan data, tokenizer, dan arsitektur tetap buatan manusia dan membawa bias. Fitur yang dipelajari juga sering sulit dijelaskan.

2.2 Word embedding: Word2Vec (Mikolov, 2013)

Setiap kata menjadi vektor. Kata dengan makna/penggunaan mirip letaknya berdekatan. Slide menunjukkan hubungan seperti man→woman sejajar dengan king→queen, juga bentuk kata kerja (walking→walked) dan negara→ibu kota.

Seperti memberi tiap kata koordinat di peta. "Raja" dan "ratu" bertetangga, "Jakarta" dan "Indonesia" punya hubungan arah yang sama dengan "Tokyo" dan "Jepang".
Dua cara melatih Word2Vec

2.3 Varian: GloVe dan FastText

Kritis: Analogi vektor (king − man + woman ≈ queen) terlihat memukau, tetapi tidak selalu berhasil dan bisa menyalin bias dari data (misalnya stereotip profesi dan gender). Klaim "lebih baik" antara GloVe dan Word2Vec juga bergantung pada data dan tugas.

2.4 Masalah: embedding statis → contextualized embedding

Word2Vec/GloVe memberi satu vektor per kata. Padahal "bank" bisa berarti banyak hal. Contextualized embedding (ELMo, BERT, GPT) menghasilkan vektor yang berubah sesuai kalimat.

Demo "bank" (klik salah satu kalimat)

Pilih kalimat di atas.

Di slide, BERT memetakan "bank" ke kelompok berbeda: lembaga keuangan, tepi/lereng tanah, gedung bank, punggungan, susunan benda, manuver pesawat. GloVe hanya satu titik.

Kritis: Plot 2D (t-SNE) membantu intuisi, tetapi memampatkan ratusan dimensi ke dua, sehingga jarak di gambar bisa menipu. Jangan jadikan gambar itu bukti formal.

3. Model

3.1 Pretraining dan fine-tuning (contoh BERT)

BERT = Bidirectional Encoder Representations from Transformers. Paradigma dua langkah:

Step 1: PretrainingStep 2: Fine-tuning
DataTeks besar tanpa label: Wikipedia (~2,5 miliar kata) + BooksCorpus (~800 juta kata)Dataset berlabel kecil (mis. email spam / bukan spam)
TugasMasked Language Modeling (tebak kata [MASK]) + Next Sentence PredictionSupervised learning: sentimen, QA, klasifikasi, dll.
HasilModel yang "mengerti bahasa" secara umumModel ahli satu tugas
Pretraining = sekolah umum bertahun-tahun. Fine-tuning = kursus singkat untuk satu profesi.

Contoh MLM: input [CLS] how are [MASK] today doing [SEP] → model menebak "you" (probabilitas tertinggi), lalu "they", "your", dst. Karena BERT melihat kiri dan kanan kata yang ditutup, ia disebut bidirectional. [CLS] menandai awal dan vektornya dipakai untuk klasifikasi, [SEP] memisahkan kalimat.

ModelArahCatatan
BERTDua arah (Transformer encoder)Bagus untuk memahami teks
GPTKiri ke kananCocok untuk menghasilkan teks
ELMoDua LSTM terpisah (kiri→kanan dan kanan→kiri) lalu digabungGabungan dangkal, bukan interaksi dua arah penuh
Kritis: Penelitian lanjutan (RoBERTa, ada di daftar bacaan slide) menunjukkan Next Sentence Prediction ternyata kurang berguna, dan BERT sebenarnya kurang dilatih. Selain itu model bidirectional tidak bisa langsung menghasilkan teks panjang seperti GPT. Itu salah satu alasan arsitektur "kiri ke kanan" mendominasi LLM modern.

3.2 Scaling laws

ModelParameterData (token)Compute (FLOPs)
BERT-base (2018)109 juta250 miliar1,6e20
GPT-3 (2020)175 miliar300 miliar3,1e23
PaLM (2022)540 miliar780 miliar2,5e24

Kaplan dkk. (2020) menemukan hukum pangkat (power law): kalau parameter, data, dan compute dinaikkan, loss turun secara teratur dan dapat diprediksi. Di grafik log-log, hubungannya berupa garis lurus. Dari slide: L(N) = (N/8,8·10¹³)^−0,076.

Demo: geser jumlah parameter

Eksponen kecil (−0,076) artinya: untuk menurunkan loss sedikit, parameter harus dinaikkan berkali-kali lipat. Mengalikan ukuran model 10x hanya menurunkan loss sekitar 16%.

Kritis: (1) Loss bukan kemampuan. Loss turun, tetapi belum tentu model lebih jujur atau lebih berguna. (2) Studi Chinchilla (Hoffmann dkk., 2022) mengoreksi Kaplan: data seharusnya ikut dinaikkan seimbang, bukan hanya parameter. Banyak model besar waktu itu kurang data. (3) Hukum ini hanya empiris, bukan hukum alam. Data teks berkualitas terbatas, jadi tren ini tidak bisa terus berlanjut tanpa batas. (4) Biaya energi dan uang membuat hanya segelintir lembaga yang mampu, yang menjadi isu keadilan riset.

3.3 In-context learning (ICL)

Brown dkk. (2020): GPT-3 (175 miliar parameter) bisa mengerjakan tugas baru hanya dari contoh di dalam prompt, tanpa mengubah bobot. Kemampuan ini tidak diprogram, melainkan muncul (emergent) setelah model cukup besar. Pada grafik TriviaQA, makin banyak contoh (zero → one → few-shot) makin tinggi akurasi, dan pada 175B few-shot menyamai/melampaui SOTA hasil fine-tuning.

Bandingkan empat cara
Kritis: (1) "Learning" di sini hanya metafora: bobot tidak berubah, pengetahuan hilang saat konteks hilang. (2) Hasil ICL sensitif terhadap urutan, format, dan pilihan contoh. (3) Klaim "emergent" diperdebatkan: sebagian peneliti (Schaeffer dkk., 2023) berpendapat lonjakan mendadak muncul karena metrik evaluasi yang tajam (benar/salah), bukan karena kemampuan benar-benar muncul tiba-tiba.

3.4 RLHF (Reinforcement Learning from Human Feedback)

Reinforcement learning: agent belajar lewat coba-coba pada sebuah environment. Agent melakukan action, environment memberi reward. Pada RLHF, "reward" berasal dari preferensi manusia. Ini yang mengubah GPT-3 mentah menjadi asisten yang mengikuti instruksi (Ouyang dkk., 2022).

Seperti melatih koki: pertama ia meniru resep (SFT), lalu belajar selera juri dari peringkat (reward model), lalu terus memasak dan memperbaiki diri berdasarkan nilai juri (PPO).
Kritis: (1) Reward hacking: model mengakali reward model, bukan benar-benar membantu. (2) Sycophancy: model cenderung menyenangkan pengguna, bahkan jika salah. (3) Preferensi pelabel sedikit orang tidak mewakili semua budaya dan nilai. (4) Mahal dan tidak stabil, sehingga muncul alternatif seperti DPO (dibahas di roadmap minggu 1–7).

4. Output: evaluasi LLM

Evaluasi yang ketat itu wajib sebelum model dipakai, agar akurat, adil, dan andal.

4.1 Closed-ended vs open-ended

Closed-endedOpen-ended
Jawaban benarSatu atau sedikitRibuan kemungkinan; ada yang lebih baik atau lebih buruk
ContohKlasifikasi sentimen, extractive QAMenulis cerita, merangkum, chatbot
EvaluasiOtomatis, seperti ML biasa (akurasi, F1)Sulit; butuh metrik khusus atau manusia

4.2 Benchmark closed-ended

Kritis: Pada leaderboard SuperGLUE di slide, beberapa model mengalahkan human baseline (89,8). Apakah berarti AI lebih paham bahasa dari manusia? Tidak tentu. Model bisa memanfaatkan pola dangkal dalam dataset. Benchmark juga cepat jenuh dan bisa terkontaminasi (soal ujian ikut terbawa di data latih).

4.3 Evaluasi teks open-ended

(a) Content overlap (BLEU, ROUGE, METEOR, CIDEr): menghitung kemiripan kata/n-gram antara hasil model dan teks acuan manusia. Cepat dan murah. (b) Model-based: BERTScore mencocokkan kata via cosine similarity embedding BERT, BLEURT adalah model regresi berbasis BERT yang menilai tata bahasa dan kesesuaian makna.

Demo: kenapa overlap bisa menipu (hitung unigram sederhana)

Coba ubah jadi "They strolled to the supermarket." Maknanya hampir sama dengan acuan, tetapi skor overlap rendah. Sebaliknya, kalimat di atas mirip secara kata tetapi maknanya berbeda (toko kelontong vs toko perkakas) dan skornya tetap lumayan.

(c) Human evaluation adalah standar emas: nilai fluency, koherensi, faktualitas, commonsense, gaya, tata bahasa, dst. Kekurangannya lambat, mahal, tidak konsisten/sulit direproduksi, bisa salah paham pertanyaan, dan skor antar studi tidak boleh dibandingkan walau dimensinya bernama sama.

(d) Side-by-side: Chatbot Arena (Chiang dkk., 2024): pengguna membandingkan dua model anonim secara acak, memilih A, B, seri, atau keduanya buruk. Hasilnya jadi peringkat model dari voting crowdsourced.

(e) LM evaluator (LLM-as-judge): LLM dipakai sebagai juri tanpa referensi (MT-bench, AlpacaEval). Jauh lebih murah dan cepat dengan korelasi tinggi terhadap manusia. Tetapi waspadai korelasi palsu: preferensi pada jawaban panjang, bias posisi (biasanya diatasi dengan pengacakan), dan self-bias GPT-4 yang menyukai jawaban gaya GPT-4.

Kritis: Chatbot Arena rawan bias: penanya bukan sampel representatif, gaya penulisan yang "enak dibaca" bisa menang meski kurang akurat. LLM-as-judge pun mewarisi bias model itu sendiri. Hukum Goodhart berlaku: saat metrik jadi target, ia berhenti jadi ukuran yang baik.

4.4 Takeaways dari slide

5. Rangkuman dan cara belajar

TopikMasalah yang diselesaikanKelemahan
Fitur manualAwal NLPMahal, tidak skalabel
Word2Vec/GloVe/FastTextMakna kata dalam vektorStatis, bias
BERT/ELMo/GPTMakna sesuai konteksBesar, butuh pretraining mahal
Scaling lawsMemprediksi manfaat model besarLoss ≠ kemampuan; batas data
In-context learningTugas baru tanpa trainingSensitif prompt; bukan belajar permanen
RLHFSelaras dengan preferensi manusiaReward hacking, sycophancy, bias
Overlap / BERTScoreEvaluasi otomatisDangkal / bergantung model
Manusia / Arena / LLM judgeMenilai kualitas sebenarnyaMahal / bias / bias model
Langkah belajar:
  1. Gambar pipeline dari ingatan, isi semua topik.
  2. Jelaskan tiap kotak "Kritis" dengan kata-katamu sendiri.
  3. Baca abstrak paper berurutan: Word2Vec → BERT → Kaplan → Brown (GPT-3) → Ouyang (RLHF).
  4. Jawab kuis di bawah sampai kamu tidak perlu menengok catatan.

6. Kuis latihan

Skor: 0/0 dijawab dari 8