Infinite-Dreamer синтезує переходи екранів для тренування GUI-агентів: донавчений на цих даних Infinite-Actor-8B додає +4,45 до Pass@1 на AndroidWorld.

Щоб зібрати траєкторії «натиснув — бачу результат», команді потрібні або люди-оператори, або симулятори. Обидва шляхи дорогі. За даними arXiv, роботу «Imagine to Act» подали 5 жовтня 2026 року: у ній пропонують відмовитися від симуляції й синтезувати переходи екранів як редагування зображень.

Чого не передають описи екрана текстом?

Наявні світові моделі для GUI-агентів описують екран словами або рендерять його з HTML, а піксельні деталі на кшталт іконок і стилів компонування при цьому зникають. Infinite-Dreamer будує синтез на піксельному рівні, щоб ці деталі залишалися в згенерованому екрані.

Людські демонстрації дають реальні траєкторії, але їх не масштабувати на величезну кількість застосунків і станів екрана. Саме ця обмеженість і робить тренування сильних агентів дорогим.

Як Infinite-Dreamer домальовує наступний екран?

Infinite-Dreamer трактує перехід інтерфейсу як задачу редагування зображення. Спочатку візіально-мовна модель (VLM) описує зміну, яку має викликати дія, у вигляді структурованого тексту описів — delta-тексту. Потім навчена на цих описах модель редагування зображень синтезує наступний скриншот.

Згенеровані дані Infinite-Dreamer бувають двох типів: однокадрові приклади для візуальної стійкості та багатокрокові уявні траєкторії.

Що показали тести на трьох бенчмарках?

Infinite-Actor — це Qwen3-VL, донавчений лише на синтезованих даних. Версія Infinite-Actor-8B покращує Pass@1 на AndroidWorld на +4,45, а на MobileWorld майже подвоює показник успішності Pass@3.

Infinite-Actor-2B додає +9,05 до Pass@1 порівняно з базовою Qwen3-VL. Обидві моделі перевіряли на AndroidWorld, MobileWorld і AndroidControl-Curated.

Найімовірніше, найбільший виграш дадуть продукти з нестандартними іконками й частими редизайнами, де HTML-рендер помиляється найчастіше. Такий синтез варто поєднувати з незалежною перевіркою результату — як у підході перевірка заяви агента даними з бази.

Що робити зараз

Почати варто з короткого пілота на екранах, де агент помиляється найчастіше.