/
Nik_voz
/
rgpu_python_analysis
Обзор
Документация
Войти
/
Nik_voz
/
rgpu_python_analysis
Код
Запросы
1
Задачи
Вики
Пакеты
0
Релизы
0
Аналитика
Безопасность
main
python_analysis/second_semestr/pract3-1.py
53 строки
3 KB
Nick-voz
another commit.
23 дек 2025, 17:37
23 дек 2025, 17:37
e0763c4
Код
Авторство
О чём код?
import os import pandas as pd from constants import Columns from dotenv import load_dotenv load_dotenv() DATASET_PATH = os.environ.get("DATASET_PATH") if DATASET_PATH is None: raise RuntimeWarning("DATASET_PATH not set") data = pd.read_csv(DATASET_PATH, sep=";") # Запрос A: средняя фактическая зарплата по полу q_a = data.groupby(Columns.GENDER)[Columns.AVERAGE_SALARY_FACT_AVG].mean() # Показал, какие средние зарплаты наблюдаются для каждой группы пола. # Можно предположить наличие разницы между группами — это сигнал для дальнейшего анализа # (например, контроль по специальности, региону, возрасту). # Выбор пола обусловлен типичностью сравнений зарплатной дискриминации. # Запрос B: средняя нормированная зарплата по уровню образования (education_level) q_b = data.groupby(Columns.EDUCATION_LEVEL)[ Columns.AVERAGE_SALARY_NORM_AVG ].mean() # Показывает, как уровень образования связан с нормированной зарплатой выпускников. # Предположение: более высокий уровень образования может соответствовать более высоким зарплатам, # но нужны контрольные переменные (направление подготовки, регион). # Выбор обусловлен интересом к влиянию образования на доход. # Запрос C: средняя фактическая зарплата по году выпуска q_c = ( data.groupby(Columns.YEAR)[Columns.AVERAGE_SALARY_FACT_AVG] .mean() .sort_index() ) # Показывает динамику средней фактической зарплаты в выборке по годам. # По результату можно судить о тренде (рост/падение) и искать причины (экономическая ситуация, изменения в наборе). # Выбран год как естественный временной фактор. print("q_a:\n", q_a) print("q_b:\n", q_b) print("q_c (head):\n", q_c.head()) # pivot_gender_edu = pd.pivot_table( # data, # values=[Columns.AVERAGE_SALARY_FACT_AVG, Columns.AVERAGE_SALARY_NORM_AVG], # index=Columns.GENDER, # columns=Columns.EDUCATION_LEVEL, # aggfunc="mean", # ) # print("pivot_gender_edu:\n", pivot_gender_edu)