Ви, мабуть, користувалися ChatGPT або чули про нього. Це інструмент, який може відповідати на запитання, писати історії та навіть допомагати з домашнім завданням. Іноді він здається чарівним, але що ж насправді стоїть за цією "магією"? Давайте зазирнемо "під капот".
📚 Етап 1: Попереднє навчання — Модель читає весь Інтернет
Уявіть собі розумного учня, який читає мільйони книг, статей, сайтів. Це перший етап навчання великих мовних моделей (LLM).
Що відбувається:
- Збір текстів: Спеціальні програми (наприклад, Common Crawl) сканують мільярди вебсторінок.
- Фільтрація:
- Видаляються спам-сайти, шкідливі та неякісні тексти.
- Залишається лише чистий текст без реклами, навігації та HTML-коду.
- Обираються тексти лише потрібними мовами (наприклад, англійською).
- Прибирається особиста інформація (імена, адреси).
- Видаляються дублікати.
Навіть після фільтрації обсяг даних залишається гігантським — десятки терабайтів!
- Токенізація: Перетворення тексту на "атомарні" частинки — токени (слова, частини слів, розділові знаки).
- Навчання: Модель вчиться передбачати наступний токен у тексті (наприклад, після "Київ — столиця..." вона вгадує "України").
- Архітектура Transformer: Це особливий тип нейромережі, яка чудово працює з послідовностями. Саме він і лежить в основі GPT.
🤖 Етап 2: Пост-навчання — Модель вчиться бути помічником
На цьому етапі з "просто читача інтернету" модель перетворюється на помічника, якого ви бачите у вигляді ChatGPT.
Як це працює:
- Люди-розмітники створюють приклади діалогів: ставлять запитання та пишуть на них хороші відповіді.
- Ці діалоги перетворюються на токени, з позначенням, хто говорить (користувач чи помічник).
- Модель вчиться відповідати ввічливо, зрозуміло, корисно.
Це якби учня навчали гарним відповідям на уроці: "відповідай чітко, доброзичливо й правдиво".
Проблема: Галюцинації
- Іноді модель "вигадує" неправдиві факти.
- Це відбувається тому, що вона намагається здогадатися, яка відповідь виглядала б переконливо, навіть якщо точно не знає.
Вирішення:
- Моделям дозволяють казати "я не знаю".
- Дають змогу використовувати інструменти — наприклад, пошук в Інтернеті або запуск коду для перевірки обчислень.
🧠 Етап 3: Навчання з підкріпленням — Модель вчиться "думати"
Це схоже на домашню роботу: спочатку ти вчився за прикладами, а тепер пробуєш самостійно розв’язувати задачі.
- Модель отримує завдання (наприклад, вирішити задачу).
- Вона пропонує кілька варіантів відповіді.
- Система визначає, яка з них краща, і "підкріплює" саме цю поведінку.
Так виникає здатність до "ланцюжка міркувань" — модель починає розписувати кроки розв’язання, замість одразу вгадувати відповідь.
RLHF — Навчання з підкріпленням від людського зворотного зв’язку
- Люди оцінюють варіанти відповіді (наприклад, який жарт про пелікана найсмішніший).
- Потім модель імітує ці оцінки, щоб сама вміти вибирати кращі варіанти.
⚙️ Чим це нагадує навчання людини?
| Етап | Що робить модель | Аналогія з учнем |
|---|---|---|
| 1. Pretraining | Читає багато тексту | Читання енциклопедій |
| 2. SFT | Навчається відповідати | Уроки з учителем |
| 3. RLHF | Самостійно практикує | Домашні завдання і практика |
❗Що важливо памʼятати про LLM
- 🧠 Вони не мають свідомості. Модель не "знає", що вона існує.
- 🎯 Вони — інструменти. Це як розумна кулькова ручка з підказками, а не живий співрозмовник.
- 🧀 Іноді помиляються в простому — наприклад, можуть неправильно порахувати літери у слові. Це називають "ефектом швейцарського сиру".
✅ Як користуватися LLM правильно
- Не вір на слово — перевіряй!
- Проси пояснити крок за кроком, якщо задача складна.
- Використовуй як помічника, а не як заміну власному мисленню.
Модель — це сильний інструмент у твоєму арсеналі. Але саме ти — головний дослідник!
Ця стаття створена на основі відео How ChatGPT Actually Works від YouTube-каналу AssemblyAI.