Files
obsidian/Programming/ML/Работа с числовыми данными.md
T
2026-07-30 11:35:10 +05:00

21 lines
2.1 KiB
Markdown

Модель принимает массив значений с плавающей запятой, называющийся *вектор признаков.*
***Вектор признаков*** - список примеров, включающих в себя признаки. В каждом примере приводятся разные значения, выглядит вектор признаков примерно так:
```
[0.78, 0.56]
```
Однако векторы используют обработаные значения, т.е нормализованные. Самые распространённые методы проектирования функций:
- ***Нормализация*** - преобразование числовых значений в заданый диапазон (например [-1,1])
- ***Биннинг (он же групирование)*** - преобразование одного признака в несколько бинарных признаков, называемых интервалами или ячейками, обычно на диапазоне значений.
Например можно разделить данные о температуре, где меньше 10 градусов - холодно, от 11 до 24 - умеренно, больше 25 - жарко
### Визуализация
Для более понятной работы с данными рекомендуется визуализировать данные с помощью pandas и matplotlib, для подтверждения гепотиз.
### Статистика
Рекомендуется собирать базовые статистические даннные
- средннее значение и медианное
- стандартное отклонение
- Значение в квартильных делениях (0, 25, 50, 75,100)
если дельта между 0 и 25 значительно отличается от дельты 75-100, то датасет содержит выбросы.