О статье

РЕШЕНИЕ ЗАДАЧИ ПРОГНОЗИРОВАНИЯ ДЛЯ ПОСЛЕДОВАТЕЛЬНОСТЕЙ СО СВЕРХБОЛЬШИМ КОЛИЧЕСТВОМ ВРЕМЕННЫХ РЯДОВ
SOLVING THE FORECASTING PROBLEM FOR SEQUENCES WITH AN ULTRA-LARGE NUMBER OF TIME SERIES

DOI: 10.46573/2658-5030-2026-3-121-129

Скачать статью

Авторы

С.В. АЛЕКСЕЕВА, С.А. ВОЙНАШ, Н.Н. ВЕРНЕР, В.А. СОКОЛОВА, С.Л. ГОРОБЧЕНКО

Аннотация

Статья посвящена решению задачи прогнозирования для последовательностей, содержащих сверхбольшое количество временных рядов (до 300 тысяч и более) и характеризующихся нестационарностью, разнородностью и наличием сезонности. Рассмотрена проблема выбора оптимальной методики прогнозирования на примере данных о продажах крупной распределительной сети. Проведен сравнительный анализ нескольких моделей временных рядов, реализованных в библиотеках языка Python (pmdarima, statsmodels, skforecast, statsforecast, sktime), включая ARIMA, SARIMA и их модификации с экзогенными факторами (ARIMAX, SARIMAX). Обоснован выбор наиболее эффективной модели SARIMAX на основе минимизации ошибки RMSE. Для повышения вычислительной эффективности при работе с массивами данных большого объема предложен подход, основанный на предварительной кластеризации рядов с использованием методов k-средних, метрик Евклида и DTW, а также оптимизации числа кластеров методами «локтя» и «силуэта». Показано, что прогнозирование на основе центроидов кластеров с последующей обратной нормировкой позволяет значительно сократить время вычислений без критической потери точности. Результаты работы подтверждают эффективность предложенного подхода для построения достоверных прогнозов в системах управления поставками.

Ключевые слова

временные ряды, прогнозирование, большие данные, кластеризация, экзогенные переменные, метод k-средних, машинное обучение, Python, оптимизация, анализ данных.

Abstract

This article addresses the problem of forecasting sequences containing an extremely large number of time series (up to 300,000 or more) characterized by non-stationarity, heterogeneity, and seasonality. The problem of choosing the optimal forecasting method is considered using sales data from a large distribution network as an example. The study provides a comparative analysis of several time series models implemented in Python libraries (pmdarima, statsmodels, skforecast, statsforecast, sktime), including ARIMA, SARIMA, and their modifications with exogenous factors (ARIMAX, SARIMAX). The choice of the most effective SARIMAX model is justified based on minimizing the RMSE error. To improve computational efficiency when working with large data sets, an approach is proposed based on preliminary clustering of series using the k-means, Euclidean, and DTW methods, as well as optimizing the number of clusters using the elbow and silhouette methods. It is shown that forecasting based on cluster centroids followed by inverse normalization significantly reduces computation time without critically losing accuracy. The results confirm the effectiveness of the proposed approach for generating reliable forecasts in supply chain management systems.

Keywords

time series, forecasting, big data, clustering, exogenous variables, k-means method, machine learning, Python, optimization, data analysis.