TokenCast прогнозує споживання токенів LLM-агента до старту задачі й оновлює оцінку під час виконання: у різних запусках однієї задачі споживання може відрізнятися більш ніж на порядок.
Автори подали метод на arXiv 28 вересня 2026 року. За даними arXiv, TokenCast вчиться на окремих сегментах виконання й перераховує прогноз без додаткових викликів LLM. Для команди, яка запускає мультистепових агентів у проді, це означає, що бюджет можна закладати до старту, а не гасити перевитрати постфактум.
Чому витрати одного агента стрибають на порядок?
Стрибок у споживанні пояснюється двома механіками. Агент обирає наступний крок за відгуком інструментів і проміжними результатами, тому одна й та сама задача щоразу йде іншим маршрутом.
Друга механіка — зростання контексту. Кожен наступний виклик зчитує накопичений контекст заново, тож вхідний розмір запитів зростає з кожним кроком. Разом ці дві причини роблять підсумкові витрати непередбачуваними до запуску: прогноз доводиться переглядати просто під час виконання.
Як TokenCast враховує повторне зчитування контексту?
Метод будує для кожного сегмента виконання окреме витратне представлення. Таке представлення фіксує власне споживання сегмента і приріст контексту, який сегмент залишає після себе.
Сусідні сегменти складаються в накопичену оцінку. Складання враховує додаткову вхідну вартість, зумовлену тим, що кожен пізніший виклик перечитує контекст ранніх сегментів. Новоспостережені дані під час виконання оновлюють прогноз без нових звернень до LLM.
Що дають 14,5% і 21,3%?
Оцінювали TokenCast на 4 наборах задач і 6 агентних моделях. Зниження середньої абсолютної похибки щодо найсильнішого порівнюваного методу становить 14,5% у середньому за 96 оцінених комбінацій.
Прогноз забирає 32,8 мс сукупного часу на запуск на SWE-bench Verified. В офлайн-прогоні контролю бюджету TokenCast витрачає на 21,3% менше токенів, ніж політика з фіксованим бюджетним лімітом, за однакової частки завершених трас.
Що робити команді, яка запускає агентів
З цих результатів випливають три кроки, які варто перевірити на власних записах.
- Логуйте витрати не лише за запуск, а за сегментами: власні токени кроку плюс приріст контексту.
- Замініть єдиний фіксований ліміт на перегляд прогнозу під час виконання й ранню зупинку дорогих трас.
- Зіставте політику з фіксованим лімітом і TokenCast на власних трасах — ще до того, як привʼязувати це до оплати.










