Почему русский текст дороже для нейросети: почему ИИ считает текст и деньги иначе

11 подписчиков

12+
12+

5 просмотров

25 дней назад

ПожаловатьсяНарушение авторских прав

11 подписчиков

12+
12+

5 просмотров

25 дней назад

ПожаловатьсяНарушение авторских прав
12+
12+

5 просмотров

25 дней назад

Нейросеть не читает слова так, как человек. Перед обработкой она разбивает текст на токены, и от этих границ зависят цена, контекст и задержка. В выпуске разбираем, что такое токен, как обучается BPE, почему русский язык иногда требует больше токенов, где прячется системный промпт и как считать реальный объём запроса. Цифры проверены локальным тестом tiktoken, а цены и лимиты — по официальным страницам OpenAI, Anthropic и Google. Телеграм: https://t.me/comrad404 00:00 Почему одинаковый смысл занимает разное число токенов 01:35 Что такое токен 03:18 Почему модель не работает со словами целиком 05:12 Как обучается BPE 07:23 Почему русский текст часто занимает больше токенов 09:34 Токеновый налог между языками 11:03 BPE, WordPiece, Unigram и SentencePiece 12:40 Невидимая часть запроса и контекст 15:07 Токены изображений, аудио и видео 16:10 Числа, код и цена генерации 17:38 Как считать и экономить токены #искусственныйинтеллект #нейросети #токены #ChatGPT #Claude #Gemini #Comrad404

Название:

Почему русский текст дороже для нейросети: почему ИИ считает текст и деньги иначе

Категория:

Разное