Post-Training: dari Model Bahasa ke Asisten yang Membantu
Materi ini disusun dari slide W5 (adaptasi Stanford CS224N, Diyi Yang). Tujuannya: kamu paham apa yang terjadi, kenapa perlu, dan apa kelemahannya. Centang setiap bagian di daftar isi setelah selesai. Ada kotak Catatan kritis untuk melatih berpikir kritis, dan kuis di akhir.
1. Masalah: language modeling ≠ membantu pengguna
Model bahasa besar (GPT-3, PaLM, Chinchilla) dilatih pretraining: membaca teks sangat banyak dan belajar satu hal, yaitu menebak kata berikutnya. Slide 3-4 menunjukkan tren: komputasi dan data terus membesar (BERT 3 miliar token, GPT-3 200 miliar, Chinchilla 1,4 triliun; anak 13 tahun kurang dari 100 juta).
Kesimpulan: model pretrained tidak aligned (selaras) dengan maksud pengguna. Pelatihan lanjutan setelah pretraining inilah yang disebut post-training.
2. Instruction finetuning (SFT)
Ide dasar
Kumpulkan banyak pasangan (instruksi, jawaban ideal) dari banyak jenis tugas, lalu latih ulang (finetune) model dengan pasangan itu. Pretraining = belajar bahasa umum; instruction finetuning = belajar cara merespons perintah. Slide 10-12 membedakan: finetune biasa untuk satu tugas (misal sentimen) vs finetune untuk banyak tugas sekaligus.
Yang diuji adalah tugas yang belum pernah dilihat (unseen tasks). Contoh slide 12: model diminta menalar "Bisakah Geoffrey Hinton ngobrol dengan George Washington?" lalu menjawab "tidak" karena hidup di era berbeda.
Data dan skala
| Nama | Isi | Catatan |
|---|---|---|
| Super-NaturalInstructions | 1.600+ tugas, 3 juta+ contoh | Klasifikasi, tagging, rewriting, terjemahan, QA |
| FLAN-T5 | T5 + 1,8 ribu tugas tambahan | Model besar untung lebih banyak |
| Alpaca | LLaMA 7B + 52 ribu contoh | Datanya dibuat oleh LM lain (self-instruct, 175 tugas awal) |
| LIMA | sekitar 1.000 contoh pilihan | "Less is more for alignment" |
Bukti hasil (slide 18-20)
Pada BIG-bench+MMLU, FLAN-T5 selalu lebih baik dari T5 biasa, dan makin besar model, makin besar peningkatannya: +6,1 (80 juta parameter) naik menjadi +26,6 (11 miliar). Sebelum finetuning, model hanya mengulang kalimat soal; sesudahnya menjawab "(C) Ambiguous" dengan alasan.
Cara mengukur: benchmark
MMLU: pilihan ganda 57 bidang (astronomi, biologi SMA, hukum, dst), mengukur pengetahuan. BIG-Bench: 200+ tugas (penalaran, matematika, bahasa, pemrograman). Skor MMLU rata-rata naik dari sekitar 28% (RoBERTa 2019) ke sekitar 85-90% (model 2023-2024).
3. Kenapa SFT belum cukup?
Masalah 0: menulis jawaban ideal oleh manusia itu mahal.
Masalah 1: tugas terbuka (cerita tentang anjing dan belalang peliharaannya) tidak punya satu jawaban benar. Mau meniru yang mana?
Masalah 2: loss bahasa menghukum semua kesalahan token sama berat. Slide 24: kalimat "Avatar is a fantasy TV show". Kalau model menulis "adventure" (dekat) atau "musical" (jauh salah), loss-nya sama-sama dianggap "bukan kata asli". Padahal kesalahannya tidak sama parah.
4. Dasar reinforcement learning (RL)
Bayangkan tiap ringkasan s diberi nilai manusia R(s) (makin tinggi makin bagus). Slide 25: ringkasan gempa yang akurat bernilai 8,0; ringkasan yang melenceng bernilai 1,2. Tujuan kita:
maksimalkan E_{ŝ ~ p_θ(s)} [ R(ŝ) ] (rata-rata reward dari sampel model)Artinya: ubah parameter θ supaya jawaban yang dihasilkan model rata-rata berreward tinggi.
Kerangka RL (slide 28)
Agent (model) punya policy (aturan memilih kata). Ia melakukan action (menulis teks) ke environment, lalu mendapat reward. Algoritma belajar memperbarui policy.
Kenapa tidak gradient ascent biasa?
Dua kendala (slide 27): (a) bagaimana memperkirakan ekspektasi atas teks yang disampling, dan (b) reward manusia tidak differentiable (tidak bisa diturunkan). Jawabannya policy gradient (REINFORCE): naikkan peluang teks berreward tinggi, turunkan peluang yang rendah.
PPO (Proximal Policy Optimization)
REINFORCE punya masalah: gradien sangat berfluktuasi (variance tinggi), pelatihan tidak stabil, boros sampel. Ide PPO: batasi seberapa jauh policy boleh berubah dalam satu update.
L = E[ min( r(θ)·A , clip(r(θ), 1−ε, 1+ε)·A ) ]r(θ) = p_baru(s) / p_lama(s), yaitu rasio peluang. A = advantage, seberapa lebih baik dari yang diharapkan. ε = batas (misal 0,2). Jika rasio keluar dari rentang 0,8-1,2, gradiennya "dipotong", jadi model tidak lompat terlalu jauh.
5. Reward model: meniru selera manusia
Masalah 1: meminta manusia menilai setiap output saat training sangat mahal. Solusi: latih model terpisah, reward model (RM), untuk menebak nilai yang akan diberi manusia, lalu pakai RM sebagai pengganti manusia.
Masalah 2: nilai angka manusia berisik dan tidak konsisten (ringkasan s3: 4,1? 6,6? 3,2?). Solusi: jangan minta angka, minta perbandingan berpasangan ("mana lebih baik, A atau B?"), karena manusia lebih konsisten memilih daripada memberi skor.
Loss Bradley-Terry
J(φ) = − E[ log σ( RM(s_menang) − RM(s_kalah) ) ]σ adalah fungsi sigmoid. Loss kecil jika skor jawaban yang dipilih manusia lebih tinggi daripada yang kalah. Yang dipelajari hanya selisih, bukan angka mutlak.
6. RLHF: menyatukan semuanya
Reward yang dioptimalkan pada langkah 3:
R(s) = RM_φ(s) − β · log( p_RL(s) / p_PT(s) )Suku kedua adalah penalti KL. Jika model RL mulai menghasilkan teks yang jauh berbeda dari model asal (p_RL jauh lebih besar dari p_PT), reward dikurangi. Tanpa penalti ini, model akan menyimpang dan mengejar skor RM dengan cara aneh. β mengatur seberapa ketat "tali pengikatnya".
Hasil (Stiennon 2020, ringkasan berita)
Fraksi ringkasan yang lebih disukai manusia dibanding ringkasan referensi: hanya pretrain ≈ 0,2-0,36; supervised ≈ 0,39-0,43; RLHF ≈ 0,6-0,7. Jadi RLHF mengalahkan pretraining + SFT, bahkan melewati ringkasan buatan manusia (garis 0,5).
7. InstructGPT dan ChatGPT
InstructGPT (Ouyang 2022) menerapkan RLHF dalam skala besar: sekitar 30 ribu tugas. Prompt berasal dari tiga sumber: plain (labeler membuat tugas bebas), few-shot (instruksi + contoh), user-based (kasus penggunaan dari daftar tunggu API OpenAI).
Bukti: untuk "Write a short poem about a wise frog", GPT-3 hanya menambah perintah lain, sedangkan InstructGPT benar-benar menulis puisi.
ChatGPT: metode sama, tetapi data berupa dialog. Pelatih manusia memerankan pengguna dan asisten (SFT), lalu jawaban model diranking (RM), lalu PPO, diulang beberapa iterasi.
Studi terkontrol (Dubois 2023, slide 46): PPO bekerja, tetapi baseline sederhana seperti Best-of-n (ambil jawaban terbaik dari n sampel menurut RM) juga cukup bagus. Banyak penelitian memakai feedback GPT-4 sebagai pengganti manusia (simulated).
8. Keterbatasan RL dan reward modeling
a) Reward hacking
Agen mengejar angka reward, bukan tujuan sebenarnya. Contoh klasik (slide 49, OpenAI "faulty reward functions"): di game balap perahu, agen berputar-putar mengumpulkan bonus alih-alih menyelesaikan lomba, karena skor tinggi.
b) Terdengar benar, belum tentu benar
Chatbot diberi hadiah karena jawaban tampak berwibawa dan membantu. Akibatnya bisa mengarang fakta (halusinasi). Slide 50: Bing AI keliru soal Super Bowl dan chatbot Google (Bard) salah pada peluncurannya, memicu saham turun sekitar 100 miliar dolar.
c) Over-optimization reward model
Ini Hukum Goodhart: ketika ukuran dijadikan target, ia berhenti jadi ukuran yang baik. Karena itu penalti KL penting.
d) Dari mana label? Bias annotator
Label RLHF sering dikerjakan pekerja berupah rendah di luar negeri (slide 58; laporan TIME: pekerja Kenya di bawah 2 dolar per jam). Demografi labeler sempit (slide 59: mayoritas Asia Tenggara, 25-34 tahun, sarjana). OpinionQA menunjukkan model hasil tuning cenderung condong ke kelompok tertentu. Contoh slide 60: reward model Starling 7B memberi skor berbeda pada "I am from {country}" tergantung negaranya, sehingga ada bias tak disengaja.
9. Perkembangan lanjutan
DPO (Direct Preference Optimization): melatih langsung dari pasangan menang-kalah tanpa reward model terpisah dan tanpa loop RL, jadi lebih sederhana. GRPO: varian PPO yang membandingkan sekelompok jawaban untuk satu prompt (slide hanya menyebut namanya, jadi pelajari dari sumber lain untuk detail). RLAIF (Bai 2022): umpan balik dari AI untuk menekan biaya manusia. Juga finetuning LM pada output sendiri.
Pesan penutup slide: RLHF masih area yang cepat berkembang dan mahal datanya, dan keterbatasan seperti halusinasi mungkin tidak selesai hanya dengan RLHF.