Штучний інтелект і машинне навчання

Великі мовні моделі

Що таке Large Language Model, як працюють мовні моделі, навчання на текстових даних, формування відповіді на основі ймовірностей та варіативність відповідей

Великі мовні моделі

🎯 Мета розділу

  • Зрозуміти, що таке велика мовна модель (LLM) та як вона працює.
  • Побачити, що відповіді AI базуються на ймовірностях, а не на «розумінні».
  • Зрозуміти, чому один і той самий запит може давати різні відповіді.

🔑 Ключові терміни

  • Large Language Model (LLM): нейромережева модель із мільярдами параметрів, навчена на величезних обсягах тексту.
  • Токен (Token): мінімальна одиниця тексту, яку обробляє модель (слово, частина слова або символ).
  • Температура (Temperature): параметр, що контролює ступінь «креативності» (випадковості) відповідей моделі.
  • Контекстне вікно (Context Window): максимальний обсяг тексту, який модель може обробити за один раз.

Що таке Large Language Model

Велика мовна модель (Large Language Model, LLM) — це нейромережева модель, навчена на величезних обсягах текстових даних для розуміння та генерації людської мови. «Велика» означає мільярди (а іноді трильйони) внутрішніх параметрів — числових значень, які модель налаштовує під час навчання.

Прикладами LLM є GPT-4 (OpenAI), Gemini (Google), Claude (Anthropic), LLaMA (Meta). Саме LLM стоять за популярними AI-асистентами, з якими ви працюєте в цьому курсі.


Навчання мовної моделі на текстових даних

Процес навчання LLM спрощено виглядає так:

  1. Збір даних. Модель навчається на мільярдах текстів з інтернету: книг, статей, вебсайтів, форумів, документації, коду. Це як прочитати всі книги у найбільшій бібліотеці світу.
  2. Навчання передбаченню наступного слова. Основне завдання під час навчання: прочитавши послідовність слів, передбачити наступне. Наприклад, для тексту «Столиця України —» модель має передбачити «Київ». Мільярди таких прикладів формують «розуміння» структури мови.
  3. Тонке налаштування (fine-tuning). Після базового навчання модель додатково навчають відповідати на питання, дотримуватися інструкцій та бути корисною. Цей етап включає навчання з людським зворотним зв'язком (RLHF — Reinforcement Learning from Human Feedback).
Важливо: LLM не зберігає тексти, на яких навчалася. Вона зберігає статистичні закономірності — зв'язки між словами, фразами та концепціями. Це як різниця між запам'ятовуванням підручника напам'ять і розумінням принципів, які в ньому викладені.

Формування відповіді на основі ймовірностей

Коли ви задаєте питання LLM, вона не «думає» над відповіддю. Вона виконує послідовне передбачення токенів: генерує перше слово відповіді (найбільш імовірне з урахуванням запиту), потім друге (з урахуванням запиту + першого слова), потім третє (з урахуванням запиту + перших двох слів) і так далі, доки не сформує повну відповідь.

Loading diagram...
@startuml
skinparam style plain
skinparam backgroundColor #FFFFFF
skinparam packageBackgroundColor #F8FAFC
skinparam packageBorderColor #64748B

rectangle "Вхідний текст\n\"Столиця Франції —\"" as InTxt #EFF6FF
rectangle "Токенізація\n[Token 1, Token 2, ...]" as Tok #DBEAFE
rectangle "Трансформер (Self-Attention)\nАналіз контексту та ваги зв'язків" as Trans #93C5FD
rectangle "Розподіл ймовірностей (Softmax)\n\"Париж\" (85%)\n\"місто\" (8%)\n\"це\" (5%)" as Softmax #DCFCE7
rectangle "Генерація наступного токена\n+ авторегресійний цикл" as OutTok #FEF3C7

InTxt -> Tok : Розбиття на токени
Tok -> Trans : Ембеддінги
Trans -> Softmax : Обчислення логітів
Softmax -> OutTok : Вибір за температурою T
OutTok -up-> InTxt : Додавання до контексту

@enduml

Кожен токен обирається з розподілу ймовірностей. Для запиту «Столиця Франції —» токен «Париж» матиме найвищу ймовірність, але токени «місто», «це» теж матимуть ненульову ймовірність.


Варіативність відповідей мовної моделі

Ви могли помітити, що один і той самий запит до AI може давати різні відповіді при кожному зверненні. Це не помилка — це наслідок стохастичної (випадкової) природи генерації.

Параметр температура (temperature) контролює ступінь випадковості:

  • Низька температура (0.0-0.3): модель обирає найбільш імовірні токени, відповіді стабільні та передбачувані.
  • Висока температура (0.7-1.0): модель частіше обирає менш імовірні токени, відповіді більш креативні та різноманітні, але й менш надійні.
Це пояснює, чому при повторному запиті ви можете отримати іншу відповідь. Для фактичних запитань краще використовувати низьку температуру, для креативних задач — вищу. Деякі AI-асистенти дозволяють налаштовувати цей параметр.

Практичні завдання


Запитання для самоконтролю

Copyright © 2026