Кросс-энтропия. Сжатие — это интеллект. Часть 2

5 тыс. подписчиков

12+
12+

123 просмотра

2 месяца назад

ПожаловатьсяНарушение авторских прав

5 тыс. подписчиков

12+
12+

123 просмотра

2 месяца назад

ПожаловатьсяНарушение авторских прав
12+
12+

123 просмотра

2 месяца назад

Откуда берется функция потерь для обучения больших языковых моделей. Первое видео: https://rutube.ru/video/2c107d5da78dd572f481252964412dd6/ Языковые деревья и архивирование Обзор оптимальных кодов Определение кросс-энтропии Интуитивное понимание и примеры Применение к языковым деревьям Предварительное обучение больших языковых моделей Что делает эту функцию потерь лучшей? Дистилляция 3b1b Talent KL-расхождение