Перейти к содержимому

НейросетиРазбор

Что значат токены и контекстное окно в описании нейросети

Контекст на 200 тысяч токенов, четыре доллара за миллион входных. В описаниях моделей полно цифр, которые трудно перевести на человеческий язык. Переводим и считаем на живом примере.

Иллюстрация к материалу «Что значат токены и контекстное окно в описании нейросети» — рубрика Нейросети
Содержание6 разделов

Коротко

  • Токен это кусочек текста, с которым работает модель: слово, часть слова или знак препинания.
  • Русский текст обычно расходует больше токенов на слово, чем английский.
  • Контекстное окно показывает, сколько токенов модель видит сразу: запрос, документы и весь диалог.
  • В API платят отдельно за вход и выход, и выход в несколько раз дороже.

Что такое токен в нейросети

Модель не читает текст по буквам или словам. Перед обработкой текст режут на токены по словарю, который собрали при обучении. Частые слова становятся одним токеном, редкие делятся на несколько кусочков. Слово «нейросеть» может разбиться на два-три токена, а пробел с буквой или знак препинания стать отдельным.

Для английского есть привычная прикидка: один токен примерно равен трём четвертям слова. Русский текст токенизируется менее экономно, потому что словари большинства моделей собирали в основном на английских текстах. В среднем одно русское слово занимает больше одного токена, а насколько больше, зависит от модели. Российские модели и последние поколения зарубежных обрабатывают кириллицу заметно экономнее, чем их предшественники.

Сколько токенов в странице текста

Точный пересчёт зависит от модели, но для ориентира подойдёт такая таблица.

Токенов Примерно русского текста
1 000 Полстраницы или страница
32 000 Небольшая брошюра, 20-30 страниц
128 000 Средняя книга или пачка договоров
200 000 Большая книга
1 000 000 Несколько книг или крупный программный проект

Проще всего проверить на своём тексте. У многих разработчиков есть онлайн-счётчики токенов, а в API число токенов возвращается с каждым ответом.

Что такое контекстное окно нейросети

В окно на один запрос входит всё сразу: системные инструкции, ваш текущий вопрос, приложенные документы, вся предыдущая переписка в чате и сам ответ модели. Если сумма не влезает, старая часть диалога отбрасывается или сервис выдаёт ошибку.

Отсюда несколько практических выводов. Если модель «забыла», о чём вы договорились в начале длинного чата, скорее всего, начало просто вылетело из окна. Начните новый чат и коротко повторите главное. Большое окно не значит, что модель одинаково внимательно прочитает весь текст: на очень длинных документах детали из середины иногда теряются, так что важное лучше выносить в начало или конец запроса. А для больших баз документов лучше подходит RAG: в окно тогда попадают только нужные куски.

Как считается цена запросов к нейросети в токенах

В API цену указывают за миллион токенов, отдельно для входа и выхода. Вход это всё, что вы отправили модели. Выход это то, что она написала в ответ. Выходные токены дороже, потому что генерировать текст сложнее, чем читать.

Посчитаем на реальных цифрах. Claude Opus 5.5 стоит $4 за миллион входных и $20 за миллион выходных токенов. Вы отправили документ на 50 000 токенов и получили пересказ на 2 000. Вход обойдётся в 0,05 × $4 = $0,20, выход в 0,002 × $20 = $0,04, всего $0,24. Если делать это сто раз в день, выйдет $24 в день, и уже есть смысл подумать о модели подешевле для простых пересказов, например GPT-6 Luna.

Посчитайте свой случай

Ориентир: около 3 знаков русского текста на токен. Точное число зависит от модели, цены за 1 млн токенов указаны в скобках.

Ещё одна строчка в прайсах это кэш. Если вы много раз отправляете один и тот же большой кусок, например инструкцию или справочник, его можно закэшировать, и повторное чтение стоит в разы дешевле. У Opus 5.5 чтение из кэша стоит $0,20 за миллион против $4 за обычный вход. Для сервисов, которые обращаются к модели тысячи раз в день, это главная статья экономии.

Как работают лимиты токенов в подписке

В подписочных чат-ботах токены напрямую не считают, но лимиты на число сообщений устроены по той же логике. Длинные документы и долгие диалоги расходуют лимит быстрее коротких вопросов. Если лимит заканчивается к обеду, попробуйте начинать новый чат для каждой задачи, а не держать всё в одном бесконечном диалоге.

Частые вопросы о токенах и контекстном окне

Почему один и тот же текст в разных моделях занимает разное число токенов?

У каждой модели свой словарь. Одна режет слово на два кусочка, другая на четыре. Поэтому сравнивать цены моделей за миллион токенов нужно с поправкой на то, сколько токенов у каждой уходит на ваш текст.

Картинки тоже считаются в токенах нейросети?

Да. Изображение перед обработкой превращают в набор токенов, и чем больше разрешение, тем их больше.

Какое окно нужно для обычной работы?

Для писем и коротких задач хватит любого современного. Для договоров, книг и больших проектов с кодом смотрите на модели с окном от 128 тысяч токенов.

Другие слова из этой темы, от «инференса» до «квантизации», собраны в нашем словаре.

А вы упирались в лимиты чат-бота посреди работы? Как выкручивались?

Птичка messgo спрашивает, как вам материал

Как вам материал?

Поделиться

Читайте также

Комментарии

Написать комментарий

Без регистрации: имя и почта не нужны, мы подпишем вас случайным именем. Комментарий появится после проверки редакцией.