Recap Pie & AI Kyiv: From Data to Prediction — від правил до моделей машинного навчання

Pie & AI Kyiv · Event Recap

From Data to Prediction: від правил до моделей машинного навчання

Повний підсумок онлайн-заходу, практична лабораторна в Google Colab, відеозапис і відкритий notebook на GitHub.

16 вересня 2026 року відбувся онлайн-захід Pie & AI Kyiv: From Data to Prediction, присвячений практичному переходу від традиційного програмування до машинного навчання.

Близько 50 учасників зареєструвалися на подію, а 8 учасників долучилися наживо. Для всіх, хто не зміг приєднатися до прямої трансляції, тепер доступні повний відеозапис заходу та Google Colab notebook із кодом, поясненнями й результатами.

Метою зустрічі було не створення торгової стратегії, а демонстрація повного циклу роботи з даними: від формулювання питання та ручних правил до навчання, оцінювання і критичної інтерпретації моделей.

Головне питання заходу:
як перетворити звичайну таблицю історичних спостережень на коректно сформульовану задачу машинного навчання — і як зрозуміти, чи справді модель знайшла корисний сигнал?

Від традиційного програмування до ML

Практичну частину було побудовано на історичних даних акцій Alphabet/Google із тікером GOOG. Спочатку ми завантажили дані через yfinance, перевірили структуру таблиці, відсутність пропусків і побудували графік ціни закриття.

Перший підхід був навмисно простим: якщо поточна ціна перевищує певне ковзне середнє, а денна дохідність є позитивною, правило прогнозує зростання наступного дня. Це типовий приклад традиційного програмування: комп’ютер виконує умови, але сам нічого не навчається.

Перевірка на історичних даних дала близько 48% точності. Такий результат наочно показав, чому інтуїтивно привабливе правило необхідно обов’язково перевіряти, а не приймати як корисне лише через його логічність.

Як фінансові дані стають ML-задачею

Наступним кроком було сформовано цільову змінну:

  • 1 — UP: ціна закриття наступного торгового дня вища за поточну;
  • 0 — DOWN: ціна не зросла.

Для опису кожного торгового дня були створені числові ознаки: дохідність за один і п’ять днів, положення ціни відносно ковзних середніх, десятиденна волатильність і зміна обсягу торгів.

Особливу увагу було приділено data leakage. Модель не повинна отримувати інформацію з майбутнього, тому всі ознаки формувалися лише з даних, доступних на дату прогнозу, а навчальна, validation і тестова частини розташовувалися у хронологічному порядку.

Один нейрон у PyTorch

Щоб не сприймати нейронну мережу як «чорну скриньку», під час заходу було покроково продемонстровано роботу одного нейрона в PyTorch:

  • створення лінійного шару з п’ятьма входами;
  • початкова ініціалізація ваг і зміщення;
  • отримання лінійного результату;
  • перетворення результату на ймовірність за допомогою sigmoid;
  • обчислення binary cross-entropy loss;
  • розрахунок градієнтів командою loss.backward();
  • оновлення параметрів оптимізатором.

Після одного кроку навчання ймовірність правильного класу зросла приблизно з 55,8% до 57,7%. Цей простий приклад показав сутність learning: модель не отримує нове правило if, а змінює власні параметри на основі помилки.

Прогноз часового ряду з Prophet

Окремий блок було присвячено Prophet. Історичний ряд цін було перетворено у формат із колонками ds і y, після чого модель побудувала майбутню траєкторію та інтервал невизначеності.

Тут важливо розрізняти дві постановки задачі. Prophet прогнозує можливий рівень часового ряду, тоді як наступні моделі розв’язують задачу класифікації напрямку UP/DOWN. Це різні питання, тому їхні результати не можна порівнювати лише за зовнішньою схожістю графіків.

TensorFlow/Keras: повна модель класифікації

У TensorFlow/Keras було побудовано компактну нейронну мережу із шістьма вхідними ознаками, двома прихованими шарами, Dropout і sigmoid-виходом. Дані було поділено хронологічно:

  • 70% — training set;
  • 20% — validation set;
  • 10% — test set.

Параметри нормалізації обчислювалися виключно на навчальній частині. Для контролю перенавчання використовувався Early Stopping, а поріг класифікації підбирався на validation set, а не на тестових даних.

Результат на відкладеному тестовому періоді був стриманим: близько 46,33% accuracy і 49,20% ROC AUC. Перевірка за допомогою п’яти часових розбиттів дала в середньому 51,93% ± 3,43. Це свідчить про відсутність стабільної переваги над простими baseline-підходами на використаному наборі ознак і часовому періоді.

Machine Learning із SQL у BigQuery ML

Фінальна демонстрація показала, що модель можна створити без ручного Python training loop. Підготовлені дані були передані до BigQuery, а логістична регресія — створена SQL-командою CREATE MODEL.

Оцінювання за допомогою ML.EVALUATE дало приблизно 57% accuracy, 67,55% F1 Score і 54,11% ROC AUC. Проста логістична регресія виявилася конкурентною порівняно з нейронною мережею, хоча загальна здатність розрізняти класи залишилася слабкою.

Порівняння результатів

Підхід Результат Інтерпретація
Традиційне правило 48,00% accuracy Ручне правило не дало переваги.
TensorFlow/Keras 46,33% accuracy; 49,20% ROC AUC Модель не перевершила прості baselines.
TimeSeriesSplit 51,93% ± 3,43 Результат змінюється між часовими періодами.
BigQuery ML 57,00% accuracy; 54,11% ROC AUC Проста модель виявилася конкурентною, але сигнал слабкий.

Головні висновки

  1. Складніша модель не гарантує кращого результату.
  2. Baseline є обов’язковим: без нього неможливо зрозуміти, чи додає модель реальну цінність.
  3. Часовий порядок має значення: випадкове перемішування фінансових даних може створити нереалістично оптимістичну оцінку.
  4. Відсутність data leakage важливіша за красивий графік.
  5. Метрики потрібно інтерпретувати разом: accuracy без ROC AUC, confusion matrix і baseline може вводити в оману.
  6. Негативний результат також корисний: він показує межі ознак, моделі та обраного періоду.
Освітнє застереження. Продемонстровані моделі, прогнози й метрики не є інвестиційною рекомендацією, фінансовою консультацією або готовою торговою стратегією.

Повний відеозапис заходу

Подяка учасникам

Дякую всім, хто зареєструвався, долучився наживо та підтримав ініціативу Pie & AI Kyiv. Запитання, коментарі, побажання і пропозиції щодо тем наступних зустрічей можна залишати під відео або в GitHub Issues.

Автор і ведучий заходу: Валентин Верьовкін.

#PieAI #PieAIKyiv #MachineLearning #DataScience #Python #PyTorch #TensorFlow #Prophet #BigQueryML #GoogleColab

Коментарі

Популярні публікації