Штучний інтелект і машинне навчання

Machine Learning Workflow

Повний процес машинного навчання: від постановки задачі через збір та підготовку даних до навчання моделі, оцінки якості та покращення

Machine Learning Workflow

🎯 Мета розділу

  • Зрозуміти послідовність етапів створення ML-системи.
  • Усвідомити, що написання коду моделі — лише мала частина процесу.
  • Побачити, де в цьому процесі потрібна участь людини, а де допомагає AI.

🔑 Ключові терміни

  • ML Workflow: послідовність етапів від постановки задачі до розгортання моделі.
  • Підготовка даних (Data Preprocessing): очищення, трансформація та нормалізація даних для навчання.
  • Метрика якості (Quality Metric): числовий показник, що вимірює точність передбачень моделі.

Loading diagram...
@startuml
skinparam style plain
skinparam backgroundColor #FFFFFF
skinparam activityBorderColor #1E293B
skinparam activityFontSize 13

|ML Workflow Pipeline|
start

:1. Постановка бізнес-задачі;
note right #FEF3C7
  Визначення метрик якості,
  формулювання цільової змінної
end note

repeat
  :2. Збір та очищення даних;
  note right #EFF6FF
    ETL, обробка пропусків,
    видалення викидів (60-80% часу)
  end note

  :3. Feature Engineering та відбір;
  note right #EFF6FF
    Створення нових ознак,
    масштабування, кодування
  end note

  :4. Навчання та тюнінг моделі;
  note right #DCFCE7
    Train/Test Split, крос-валідація,
    підбір гіперпараметрів
  end note

  :5. Оцінка метрик та валідація;
backward:Аналіз помилок та доопрацювання;
repeat while (Якість достатня?) is (ні) not (так)

:6. Деплой у продакшен (Serving API);
:7. Моніторинг та збір зворотного зв'язку;
stop

@enduml

Етапи ML Workflow

Постановка задачі

Визначити, яку проблему має вирішити модель: що передбачати, для кого, з якою точністю. Без чіткої постановки решта етапів безглуздіі. Наприклад: «Передбачити, чи поверне клієнт кредит протягом 12 місяців, з точністю не менше 85%».

Збір, підготовка та дослідження даних

Зібрати релевантні дані, очистити їх від помилок та пропусків, дослідити розподіли та кореляції. Цей етап зазвичай займає 60-80% усього часу ML-проєкту. Дані можуть надходити з баз даних, API, файлів, вебскрапінгу.

Вибір ознак і алгоритму

Визначити, які характеристики (ознаки) використовувати для навчання, та обрати алгоритм ML. Вибір залежить від типу задачі, обсягу даних та вимог до інтерпретованості.

Навчання моделі та оцінка якості

Навчити модель на частині даних (training set) та оцінити її якість на іншій частині (test set). Якщо якість недостатня — повернутися до попередніх кроків: додати ознаки, зібрати більше даних або змінити алгоритм.

Використання моделі та покращення на нових даних

Розгорнути модель у продакшені. Моніторити її якість на реальних даних. Коли якість падає (через зміни у даних) — перенавчити модель на свіжих прикладах.

Зверніть увагу: ML Workflow — це циклічний, а не лінійний процес. Після оцінки якості часто потрібно повернутися на крок назад — зібрати більше даних, обрати інші ознаки або спробувати інший алгоритм. Ітерації — норма, а не виняток.

Практичні завдання


Запитання для самоконтролю

Copyright © 2026