This commit is contained in:
2026-07-30 11:35:10 +05:00
commit 8a3ec978ad
113 changed files with 3384 additions and 0 deletions
@@ -0,0 +1,59 @@
**Линейная регрессия*** - статистический метод, используемый для поиска взаимосвязи между переменными. В контексте машинного обучения линейная регрессия находит взаимосвязь между признаками и меткой.
***Пример*** - значения одной строки с признаками и подписью. Примеры в контролируемом машинном обучении делятся на 2 основные категории:
1. Подписанные примеры состоят из одного или более признака с подписью. Используются для обучения.
2. Не подписанные примеры состоят из одного или более признака, но без подписи. Используются для получения вывода.
Подписанные и не подписанные примеры:
![[Pasted image 20260104121346.png]]
***Признак (особенность)*** - вводная переменная машинного обучения. **Пример*** содержит в себе один или более признаков.
***Метка (подпись)*** - в контексте машинного обучения, показывает ответ для **Примера***.
Допустим. в случае обучения модели на фильтрацию спама, метка будет указывать, является ли данный пример спамом или нет.
## Уравнение линейной регрессии
В алгебраических терминах модель будет определяться как:
``` math
y = mx + b
```
где:
- y - значение, которое мы хотим предсказать
- m - наклон прямой
- x - входное значение
- b - точка пересечения с осью y
В машинном обучении мы записываем уравнение следующим образом:
```math
y' = b + w1*x1
```
где:
- y' - прогнозируемая метка (выход)
- b - смещение модели. (По сути пересечение с осью y в алгебраическом представлении.)
- w1 - вес признака. То же самое понятие что и наклон в алгебраическом уравнении.
- x1 - признак, входные данные
В процессе обучения модель рассчитывает вес и смещение, которые позволяют получить наилучшую модель.
![[Pasted image 20260104123038.png]]
А в случае если характеристик больше, уравнение будет иметь вид:
```
y = b + W1*X1 + W2*X2 + ... + Wn*Xn
```
где n - последний признак.
## Потеря
***Потери*** - числовая метрика, описывающая степень неточности предсказаний модели. Потери измеряют расстояние между предсказаниями модели и фактическими метками. Цель обучение модели - минимизировать потери, сведя их к минимальному возможному значению.
В машинном обучении потери измеряют разницу между предсказанным значением и фактическим, фокусируясь на расстоянии, а не направлении. ***То есть берется модуль разности фактической точки и предсказанной***
Два наиболее распространённых способа удаления знака:
- Абсолютное значение разности фактического значения и прогноза
- Квадрат разницы между фактическим значением и прогнозом
## Виды потерь
| Тип убытка | Определение | Уравнение |
| ------------------------------------------------ | --------------------------------------------------------------------------------- | ---------------------------------------------- |
| **Потеря L1** | Сумма абсолютных <br>значений разницы между <br>фактическим значением и прогнозом | $\sum\|факт - прогноз\|$ |
| **Средняя <br>абсолютная ошибка (MAE)** | Среднее значение потери L1 для набора <br>из N параметров | $\frac{1}{N}\sum\|факт - прогноз\|$ |
| **Потеря L2** | Сумма квадратов разностей между<br>фактическим значением и прогнозом | $\sum(факт - прогноз)^2$ |
| **Среднеквадратическая<br>ошибка (MSE)** | Среднее значение потерь L2 для набора из N параметров | $\frac{1}{N}\sum(факт - прогноз)^2$ |
| **Корень среднеквадратической<br>ошибки (RMSE)** | Корень для MSE | $\sqrt{\frac{1}{N} \sum \|факт - прогноз\|^2}$ |
Главная разница L1 и L2 - возведение в степень. Если потеря большая, возведение в степень сделает ее еще больше. Если же разница маленькая (меньше 1), то степень сделает её еще меньше.
Поэтому метрики такие как ***MAE или RMSE*** могут быть более подходящими в сравнении с L2 или MSE, так как они являются более понятными для людей, а так же они измеряют ошибку в той же шкале, что и значение прогноза модели.
==Примечание: MAE и RMSE могут существенно различаться. MAE представляет собой среднюю ошибку прогнозирования, тогда как RMSE представляет собой «разброс» ошибок и в большей степени искажается при больших ошибках.==