IT Academy
Урок 4 · Продвинутый

Sequence models, attention и transformers

Объяснение → самостоятельное решение → разбор → практика курса

Объяснение

Attention строит взвешенную сумму значений по сходству query и key. Позиционная информация нужна, чтобы различать порядок. Маска ограничивает доступ к будущим токенам при авторегрессивном обучении.

Задача для самостоятельного решения

Зачем causal mask в языковой модели?

Показать разбор ответа

Чтобы позиция не читала последующие правильные ответы. Иначе обучение решает задачу с информацией, недоступной при генерации.

Примените знания

В лабораторной курса есть учебная среда, пример, ожидаемый результат и задание проекта. Возвращайтесь к ней по мере прохождения тем.

Открыть лабораторную →