/
urfu_itis_limits
/
code-review-101-desmitry
Обзор
Документация
Войти
/
urfu_itis_limits
/
code-review-101-desmitry
Код
Запросы
0
Задачи
Вики
Пакеты
0
Релизы
0
CI/CD
Аналитика
task
README
87 строк
8 KB
smelnikov511
update README
18 ноя 2025, 15:18
18 ноя 2025, 15:18
206ea45
Код
Авторство
О чём код?
# Анализ данных о стоимости жилья в Калифорнии (Задание 5) ## 0. Информация о рецензируемых работах Этот отчет был проверен следующим сокурсником. Замечания и улучшения были внесены в соответствии с их рекомендациями. - [Нейп Риггерс](https://gitverse.ru/NonerCo) ## 1. Информация о студенте - **ФИО:** Бахматов Дмитрий Сергеевич - **Группа:** РИ-150911 - **Номер задания:** 5 ## 2. Описание задания Целью данного задания является проведение исследовательского анализа данных (Exploratory Data Analysis, EDA) на датасете **California Housing**. Основная задача — изучить распределения, взаимосвязи и корреляции между различными признаками (такими как медианный доход, возраст домов, расположение) и целевой переменной (медианной стоимостью жилья). Анализ направлен на подготовку данных и получение инсайтов для дальнейшего построения регрессионной модели предсказания стоимости жилья. ## 3. Выполненные работы В рамках задания были реализованы следующие шаги: 1. **Загрузка данных:** Сатасет `California Housing` был загружен с помощью `sklearn.datasets.fetch_california_housing` и преобразован в `pandas.DataFrame` для удобства анализа. 2. **Анализ целевой переменной:** Рассчитана и выведена основная описательная статистика для целевой переменной `MedHouseVal` (медианная стоимость дома). 3. **Анализ признаков:** Рассчитана ключевая статистика (среднее, стандартное отклонение, минимум, максимум) для всех 8 признаков в датасете. 4. **Визуализация распределений:** * Построена гистограмма и KDE-график для целевой переменной, чтобы оценить её распределение. * Созданы гистограммы для каждого признака для визуального анализа их распределений. 5. **Анализ взаимосвязей:** Построены диаграммы рассеяния (scatter plots) для каждого признака относительно целевой переменной для выявления потенциальных линейных и нелинейных зависимостей. 6. **Корреляционный анализ:** Рассчитана и визуализирована матрица корреляций для определения силы и направления линейной связи между признаками и целевой переменной. ## 4. Статистика ### Статистика по целевой переменной (`MedHouseVal`) Целевая переменная измеряется в сотнях тысяч долларов ($100,000s). | Метрика | Значение | | ------------------------ | ---------- | | Среднее | 2.068558 | | Медиана (50% перцентиль) | 1.797000 | | Стандартное отклонение | 1.153956 | | Минимум | 0.149990 | | Максимум | 5.000010 | | 25-й перцентиль (Q1) | 1.196000 | | 75-й перцентиль (Q3) | 2.647250 | ### Ключевые числа - **Средняя медианная стоимость дома:** **$206,855**. - **Самый сильный положительный коррелирующий признак:** **`MedInc`** (Медианный доход) с коэффициентом корреляции **0.688**. - **Самый сильный отрицательный коррелирующий признак:** **`Latitude`** (Широта) с коэффициентом **-0.144**. ## 5. Ключевые находки 1. **Главный фактор стоимости — доход.** Признак `MedInc` (медианный доход в квартале) имеет наиболее сильную положительную корреляцию с ценой жилья. Это подтверждается как коэффициентом корреляции, так и диаграммой рассеяния, где видна четкая линейная зависимость.  2. **Распределение стоимости жилья имеет "потолок".** На гистограмме целевой переменной виден резкий всплеск на значении 5.0. Это указывает на то, что все дома стоимостью выше $500,001 были "обрезаны" и записаны с этим максимальным значением. Это важная особенность данных, которую нужно учитывать при моделировании.  3. **Географическое положение имеет значение.** Признаки `Latitude` (широта) и `Longitude` (долгота) по отдельности имеют слабую корреляцию с ценой, однако их диаграммы рассеяния показывают наличие кластеров. Вероятно, это соответствует крупным городам (например, Лос-Анджелес, Сан-Франциско), где цены выше. 4. **Среднее количество комнат также влияет на цену.** Признак `AveRooms` (среднее количество комнат) имеет умеренную положительную корреляцию (0.15), что логично: чем больше комнат, тем дороже дом.  5. **Большинство признаков не распределены нормально.** Гистограммы признаков показывают, что многие из них (например, `Population`, `AveOccup`) имеют длинные "хвосты" справа (правосторонняя асимметрия). Для некоторых моделей машинного обучения может потребоваться трансформация (например, логарифмирование) этих признаков.  ## 6. Файлы - **Созданные файлы:** * `assignment.py` — основной скрипт с реализацией анализа. * `05_housing_target_distribution.png` — график распределения целевой переменной. * `05_housing_features_distribution.png` — графики распределения всех признаков. * `05_housing_features_vs_target.png` — диаграммы рассеяния признаков и целевой переменной. * `05_housing_correlation_bars.png` — диаграмма корреляций. * `README.md` — данный отчет. - **Удаленные файлы:** * В этом задании лишние `.md` файлы отсутствовали и не удалялись.