Проект написан в гугл коллабе. Может потребоваться редактирование путей к файлам. Коллаб это Jupiter notebook, но немного адаптированный, так что рекомендую просто экспорт папки в коллаб.
Ссылка на гугл диск - аналог: https://drive.google.com/drive/folders/1niyMjeCnbLDuzWagpN98HHKYC6N9qSIZ?usp=drive_link
Папка "Стартовые данные" содержит 3 файла с данными из источников. Джини и Доценко Джини уже предобработанны, соединены в 1 таблицу.
Джини содержит Денежные доходы в расчете на душу населения, рублей в месяц Общий прирост постоянного населения Коэффициент фондов (соотношение денежных доходов 10% наиболее и 10% наименее обеспеченного населения),
Доценко джини содержит Количество персональных компьютеров Доля домашних хозяйств с доступом к сети Интернет, % Внутренние текущие затраты на научные исследования и разработки
data содержит коэффицент джини
sberproject.ipynb содержит моделирование с prophet и предобработкой датасета.
SberARIMAX.ipynb содержит моделирование с ARIMAX
arima_summary_5years.xlsx содержит результаты обработки ARIMAX
таблица соответствий регионов.xlsx используется для склейки датасета в общий, т.к. имена регионов в источниках отличаются.
merged_df.xlsx - собранный в 1 датасет
merged_df_without_2013.xlsx - датасет после предобработки по удалению пустых и значений и параметров, от которых отказались (см. презентацию)
PREMODEL.xlsx - финальный датасет, используемый для моделирования
Бэкап - на случай коррапта, отдельный файл ранней версиию