Files
obsidian/Programming/ML/Гиперпараметры.md
T
2026-07-30 11:35:10 +05:00

3.2 KiB

Сходимость - подбор весов и смещения для получения максимально близкого к эталонному значению предсказания. Гиперпараметры - переменные, управляющие различными аспектами обучения. Итерация - единоразовое обновление значений весов и смещения во время градиентного спуска.

  1. Скорость обучения* - число float, которое мы задаём, влияет на скорость сходимости модели. Если скорость низкая, то может занимать много времени. Если скорость слишком высокая, то модель никогда не сойдется, а будет колебаться вокруг весов и смещения, которые снижают потери. Во время выполнения градиентного спуска, значения градиента умножаются на значения скорости.

  2. Batch-size (Размер пакета) - определяет количество параметров, обрабатываемых моделью перед обновлением весов и смещения. Два распространённых метода получения правильного градиента в среднем, без необходимости просматривать каждый пример в наборе данных перед обновлением весов и смещения:

    • Стохастический градиентный спуск (SGD) - использует только один пример (batch-size = 1) на итерацию. При большом количестве итераций работает, но создаёт шум - вариации во время обучения, которые приводят к увеличению потерь, а не снижению. Термин стохастический обозначает, что пример, входящий в каждую партию, выбирается случайно.
    • Мини-пакетный стохастический градиентный спуск (smal-batch SGD) - компромисс между полным пакетом и SGD. Для N количества точек данных, размер пакета может быть любым числом между 1 и N. Модель случайно выбирает параметры, включаемые в каждый пакет, усредняет их градиенты, а затем обновляет веса и смещения один раз за итерацию.
  3. Эпоха - Модель обработала каждый пример в датасете для обучения один раз. Например, для датасета из 1000 примеров и мини-пакета из 100 примеров, потребуется 10 итераций для завершения 1 эпохи.