***Сходимость*** - подбор весов и смещения для получения максимально близкого к эталонному значению предсказания. ***Гиперпараметры*** - переменные, управляющие различными аспектами обучения. ***Итерация*** - единоразовое обновление значений весов и смещения во время градиентного спуска. 1. **Скорость обучения*** - число float, которое мы задаём, влияет на скорость сходимости модели. Если скорость низкая, то может занимать много времени. Если скорость слишком высокая, то модель никогда не сойдется, а будет колебаться вокруг весов и смещения, которые снижают потери. Во время выполнения градиентного спуска, значения градиента умножаются на значения скорости. 2. ***Batch-size (Размер пакета)*** - определяет количество параметров, обрабатываемых моделью перед обновлением весов и смещения. Два распространённых метода получения правильного градиента в *среднем*, без необходимости просматривать каждый пример в наборе данных перед обновлением весов и смещения: - **Стохастический градиентный спуск (SGD)** - использует только один пример (batch-size = 1) на итерацию. При большом количестве итераций работает, но создаёт шум - вариации во время обучения, которые приводят к увеличению потерь, а не снижению. Термин *стохастический* обозначает, что пример, входящий в каждую партию, выбирается случайно. - ***Мини-пакетный стохастический градиентный спуск (smal-batch SGD)*** - компромисс между полным пакетом и SGD. Для *N* количества точек данных, размер пакета может быть любым числом между *1* и *N*. Модель случайно выбирает параметры, включаемые в каждый пакет, усредняет их градиенты, а затем обновляет веса и смещения *один раз за итерацию*. 3. ***Эпоха*** - Модель обработала каждый пример в датасете для обучения *один раз*. Например, для датасета из 1000 примеров и мини-пакета из *100 примеров*, потребуется *10 итераций* для завершения *1 эпохи*.