О статье

РЕШЕНИЕ ЗАДАЧИ ПРОГНОЗИРОВАНИЯ ДЛЯ ПОСЛЕДОВАТЕЛЬНОСТЕЙ СО СВЕРХБОЛЬШИМ КОЛИЧЕСТВОМ ВРЕМЕННЫХ РЯДОВ

DOI: 10.46573/2658-5030-2026-3-121-129

Скачать статью

Авторы

С.В. АЛЕКСЕЕВА, С.А. ВОЙНАШ, Н.Н. ВЕРНЕР, В.А. СОКОЛОВА, С.Л. ГОРОБЧЕНКО

Аннотация

Статья посвящена решению задачи прогнозирования для последовательностей, содержащих сверхбольшое количество временных рядов (до 300 тысяч и более) и характеризующихся нестационарностью, разнородностью и наличием сезонности. Рассмотрена проблема выбора оптимальной методики прогнозирования на примере данных о продажах крупной распределительной сети. Проведен сравнительный анализ нескольких моделей временных рядов, реализованных в библиотеках языка Python (pmdarima, statsmodels, skforecast, statsforecast, sktime), включая ARIMA, SARIMA и их модификации с экзогенными факторами (ARIMAX, SARIMAX). Обоснован выбор наиболее эффективной модели SARIMAX на основе минимизации ошибки RMSE. Для повышения вычислительной эффективности при работе с массивами данных большого объема предложен подход, основанный на предварительной кластеризации рядов с использованием методов k-средних, метрик Евклида и DTW, а также оптимизации числа кластеров методами «локтя» и «силуэта». Показано, что прогнозирование на основе центроидов кластеров с последующей обратной нормировкой позволяет значительно сократить время вычислений без критической потери точности. Результаты работы подтверждают эффективность предложенного подхода для построения достоверных прогнозов в системах управления поставками.

Ключевые слова

временные ряды, прогнозирование, большие данные, кластеризация, экзогенные переменные, метод k-средних, машинное обучение, Python, оптимизация, анализ данных.