Як "думають" і вчаться великі мовні моделі, наприклад ChatGPT

4 серпня 2025

Ви, мабуть, користувалися ChatGPT або чули про нього. Це інструмент, який може відповідати на запитання, писати історії та навіть допомагати з домашнім завданням. Іноді він здається чарівним, але що ж насправді стоїть за цією "магією"? Давайте зазирнемо "під капот".

📚 Етап 1: Попереднє навчання — Модель читає весь Інтернет

Уявіть собі розумного учня, який читає мільйони книг, статей, сайтів. Це перший етап навчання великих мовних моделей (LLM).

Що відбувається:

  • Збір текстів: Спеціальні програми (наприклад, Common Crawl) сканують мільярди вебсторінок.
  • Фільтрація:
    • Видаляються спам-сайти, шкідливі та неякісні тексти.
    • Залишається лише чистий текст без реклами, навігації та HTML-коду.
    • Обираються тексти лише потрібними мовами (наприклад, англійською).
    • Прибирається особиста інформація (імена, адреси).
    • Видаляються дублікати.

Навіть після фільтрації обсяг даних залишається гігантським — десятки терабайтів!

  • Токенізація: Перетворення тексту на "атомарні" частинки — токени (слова, частини слів, розділові знаки).
  • Навчання: Модель вчиться передбачати наступний токен у тексті (наприклад, після "Київ — столиця..." вона вгадує "України").
  • Архітектура Transformer: Це особливий тип нейромережі, яка чудово працює з послідовностями. Саме він і лежить в основі GPT.

🤖 Етап 2: Пост-навчання — Модель вчиться бути помічником

На цьому етапі з "просто читача інтернету" модель перетворюється на помічника, якого ви бачите у вигляді ChatGPT.

Як це працює:

  • Люди-розмітники створюють приклади діалогів: ставлять запитання та пишуть на них хороші відповіді.
  • Ці діалоги перетворюються на токени, з позначенням, хто говорить (користувач чи помічник).
  • Модель вчиться відповідати ввічливо, зрозуміло, корисно.

Це якби учня навчали гарним відповідям на уроці: "відповідай чітко, доброзичливо й правдиво".

Проблема: Галюцинації

  • Іноді модель "вигадує" неправдиві факти.
  • Це відбувається тому, що вона намагається здогадатися, яка відповідь виглядала б переконливо, навіть якщо точно не знає.

Вирішення:

  • Моделям дозволяють казати "я не знаю".
  • Дають змогу використовувати інструменти — наприклад, пошук в Інтернеті або запуск коду для перевірки обчислень.

🧠 Етап 3: Навчання з підкріпленням — Модель вчиться "думати"

Це схоже на домашню роботу: спочатку ти вчився за прикладами, а тепер пробуєш самостійно розв’язувати задачі.

  • Модель отримує завдання (наприклад, вирішити задачу).
  • Вона пропонує кілька варіантів відповіді.
  • Система визначає, яка з них краща, і "підкріплює" саме цю поведінку.

Так виникає здатність до "ланцюжка міркувань" — модель починає розписувати кроки розв’язання, замість одразу вгадувати відповідь.

RLHF — Навчання з підкріпленням від людського зворотного зв’язку

  • Люди оцінюють варіанти відповіді (наприклад, який жарт про пелікана найсмішніший).
  • Потім модель імітує ці оцінки, щоб сама вміти вибирати кращі варіанти.

⚙️ Чим це нагадує навчання людини?

ЕтапЩо робить модельАналогія з учнем
1. PretrainingЧитає багато текстуЧитання енциклопедій
2. SFTНавчається відповідатиУроки з учителем
3. RLHFСамостійно практикуєДомашні завдання і практика

❗Що важливо памʼятати про LLM

  • 🧠 Вони не мають свідомості. Модель не "знає", що вона існує.
  • 🎯 Вони — інструменти. Це як розумна кулькова ручка з підказками, а не живий співрозмовник.
  • 🧀 Іноді помиляються в простому — наприклад, можуть неправильно порахувати літери у слові. Це називають "ефектом швейцарського сиру".

✅ Як користуватися LLM правильно

  • Не вір на слово — перевіряй!
  • Проси пояснити крок за кроком, якщо задача складна.
  • Використовуй як помічника, а не як заміну власному мисленню.

Модель — це сильний інструмент у твоєму арсеналі. Але саме ти — головний дослідник!

Ця стаття створена на основі відео How ChatGPT Actually Works від YouTube-каналу AssemblyAI.