Files
obsidian/Programming/ML/Линейная регрессия.md
T
2026-07-30 11:35:10 +05:00

6.9 KiB

Линейная регрессия* - статистический метод, используемый для поиска взаимосвязи между переменными. В контексте машинного обучения линейная регрессия находит взаимосвязь между признаками и меткой. Пример - значения одной строки с признаками и подписью. Примеры в контролируемом машинном обучении делятся на 2 основные категории:

  1. Подписанные примеры состоят из одного или более признака с подписью. Используются для обучения.
  2. Не подписанные примеры состоят из одного или более признака, но без подписи. Используются для получения вывода. Подписанные и не подписанные примеры: !Pasted image 20260104121346.png Признак (особенность) - вводная переменная машинного обучения. Пример* содержит в себе один или более признаков. Метка (подпись) - в контексте машинного обучения, показывает ответ для Примера*. Допустим. в случае обучения модели на фильтрацию спама, метка будет указывать, является ли данный пример спамом или нет.

Уравнение линейной регрессии

В алгебраических терминах модель будет определяться как:

y = mx + b

где:

  • y - значение, которое мы хотим предсказать
  • m - наклон прямой
  • x - входное значение
  • b - точка пересечения с осью y В машинном обучении мы записываем уравнение следующим образом:
y' = b + w1*x1

где:

  • y' - прогнозируемая метка (выход)
  • b - смещение модели. (По сути пересечение с осью y в алгебраическом представлении.)
  • w1 - вес признака. То же самое понятие что и наклон в алгебраическом уравнении.
  • x1 - признак, входные данные В процессе обучения модель рассчитывает вес и смещение, которые позволяют получить наилучшую модель. !Pasted image 20260104123038.png

А в случае если характеристик больше, уравнение будет иметь вид:

y = b + W1*X1 + W2*X2 + ... + Wn*Xn

где n - последний признак.

Потеря

Потери - числовая метрика, описывающая степень неточности предсказаний модели. Потери измеряют расстояние между предсказаниями модели и фактическими метками. Цель обучение модели - минимизировать потери, сведя их к минимальному возможному значению.

В машинном обучении потери измеряют разницу между предсказанным значением и фактическим, фокусируясь на расстоянии, а не направлении. То есть берется модуль разности фактической точки и предсказанной Два наиболее распространённых способа удаления знака:

  • Абсолютное значение разности фактического значения и прогноза
  • Квадрат разницы между фактическим значением и прогнозом

Виды потерь

Тип убытка Определение Уравнение
Потеря L1 Сумма абсолютных
значений разницы между
фактическим значением и прогнозом
\sum\|факт - прогноз\|
Средняя
абсолютная ошибка (MAE)
Среднее значение потери L1 для набора
из N параметров
\frac{1}{N}\sum\|факт - прогноз\|
Потеря L2 Сумма квадратов разностей между
фактическим значением и прогнозом
\sum(факт - прогноз)^2
Среднеквадратическая
ошибка (MSE)
Среднее значение потерь L2 для набора из N параметров \frac{1}{N}\sum(факт - прогноз)^2
Корень среднеквадратической
ошибки (RMSE)
Корень для MSE \sqrt{\frac{1}{N} \sum \|факт - прогноз\|^2}
Главная разница L1 и L2 - возведение в степень. Если потеря большая, возведение в степень сделает ее еще больше. Если же разница маленькая (меньше 1), то степень сделает её еще меньше.
Поэтому метрики такие как MAE или RMSE могут быть более подходящими в сравнении с L2 или MSE, так как они являются более понятными для людей, а так же они измеряют ошибку в той же шкале, что и значение прогноза модели.
==Примечание: MAE и RMSE могут существенно различаться. MAE представляет собой среднюю ошибку прогнозирования, тогда как RMSE представляет собой «разброс» ошибок и в большей степени искажается при больших ошибках.==