Объяснение
Backpropagation вычисляет градиенты по цепному правилу. Optimizer обновляет веса; градиенты обычно нужно обнулять между шагами. Learning rate определяет размер шага и влияет на устойчивость.
Задача для самостоятельного решения
Почему loss может расти при большом learning rate?
Показать разбор ответа
Шаг перепрыгивает области низкой ошибки и вызывает расходимость. Уменьшите rate, проверьте масштаб данных и градиенты, сравните с маленькой задачей.