Files
obsidian/Programming/ML/Гиперпараметры.md
T
2026-07-30 11:35:10 +05:00

10 lines
3.2 KiB
Markdown

***Сходимость*** - подбор весов и смещения для получения максимально близкого к эталонному значению предсказания.
***Гиперпараметры*** - переменные, управляющие различными аспектами обучения.
***Итерация*** - единоразовое обновление значений весов и смещения во время градиентного спуска.
1. **Скорость обучения*** - число float, которое мы задаём, влияет на скорость сходимости модели. Если скорость низкая, то может занимать много времени. Если скорость слишком высокая, то модель никогда не сойдется, а будет колебаться вокруг весов и смещения, которые снижают потери. Во время выполнения градиентного спуска, значения градиента умножаются на значения скорости.
2. ***Batch-size (Размер пакета)*** - определяет количество параметров, обрабатываемых моделью перед обновлением весов и смещения. Два распространённых метода получения правильного градиента в *среднем*, без необходимости просматривать каждый пример в наборе данных перед обновлением весов и смещения:
- **Стохастический градиентный спуск (SGD)** - использует только один пример (batch-size = 1) на итерацию. При большом количестве итераций работает, но создаёт шум - вариации во время обучения, которые приводят к увеличению потерь, а не снижению. Термин *стохастический* обозначает, что пример, входящий в каждую партию, выбирается случайно.
- ***Мини-пакетный стохастический градиентный спуск (smal-batch SGD)*** - компромисс между полным пакетом и SGD. Для *N* количества точек данных, размер пакета может быть любым числом между *1* и *N*. Модель случайно выбирает параметры, включаемые в каждый пакет, усредняет их градиенты, а затем обновляет веса и смещения *один раз за итерацию*.
3. ***Эпоха*** - Модель обработала каждый пример в датасете для обучения *один раз*. Например, для датасета из 1000 примеров и мини-пакета из *100 примеров*, потребуется *10 итераций* для завершения *1 эпохи*.