Как ИИ понимает слова: трансформеры и attention без магии
Почему современные нейросети понимают связь между словами, обрабатывают длинный контекст и генерируют текст? Разбираем Transformer с самого начала: от RNN и LSTM до механизма attention, Q/K/V, multi-head attention, позиционного кодирования, FlashAttention, KV-cache, GQA, Mamba и гибридных архитектур. В выпуске показаны оригинальные исследования и отдельные анимированные схемы. Вы увидите, как запрос сравнивается с ключами, как оценки превращаются в веса, чем отличаются encoder и decoder, почему длинный контекст дорог и какие решения появились после классического Transformer. Telegram Comrad404: https://t.me/comrad404 Главы: 00:00 Модель 2017 года, на которой вырос современный ИИ 01:15 Что было до трансформеров: RNN и LSTM 03:22 Как работают Q, K и V 06:50 Multi-head attention и внутренний блок Transformer 09:26 Как модель понимает порядок слов 10:22 Encoder, decoder, BERT, GPT и T5 12:11 Почему attention дорого считать 15:19 Длинный контекст и Lost in the Middle 16:30 RWKV, Mamba и гибридные архитектуры 18:07 Что осталось от оригинального Transformer #искусственныйинтеллект #нейросети #трансформеры #машинноеобучение #Comrad404
Название:
Как ИИ понимает слова: трансформеры и attention без магии
Категория:
Разное