Reka AI випустила дослідницьке превʼю Rho-1 — 19-мільярної омні-моделі, яка обробляє та генерує текст, зображення, відео й команди керування роботом в одній нейромережі.

Для команд, які будують агентів на кількох спеціалізованих моделях, головна зміна — зникає окремий шар маршрутизації. За даними The Decoder, Reka AI Rho-1 виконує всі модальності як токени в одному спільному вікні контексту, без викликів інструментів і зовнішніх моделей.

Що дає спільне вікно контексту?

Reka AI Rho-1 генерує безперервне відео в реальному часі й реагує на нові інструкції під час роботи, без перезапуску.

Один артефакт версіонується замість кількох, а тести відтворюються без розсинхронізації модулів. Перевірте на своєму стенді, скільки коду оркестрації та журналів налагодження залишиться, якщо прибрати окремі моделі.

Звідки Rho-1 бере сигнали керування роботом?

Ті самі ваги, які прогнозують зображення з камери, керують рухами робота.

Щоб обійти брак даних з робототехніки, Reka AI створила модель зворотної динаміки — вона витягує сигнали керування зі звичайних відео в інтернеті. Навчання Reka AI Rho-1 тривало близько трьох місяців на 320 H100.

Три місяці на 320 H100 — це поріг входу, який не кожен стартап захоче повторювати. Дешевше перевірити гіпотезу на готовому превʼю: підготуйте власні відео з роботом і подивіться, чи переносяться дії на вашу кінематику.

Що змінилося порівняно з Reka Core?

Reka AI випустила Reka Core у квітні 2024 року — мультимодальну мовну модель, що змагалася з GPT-4, Claude 3 і Gemini Ultra на бенчмарках.

Реліз Rho-1 вписується в ширший рух досліджень до так званих світових моделей.

Для українських команд це вибір між зрілим текстовим ядром і раннім універсальним середовищем. Ймовірно, універсальна модель не звільняє від звіряння результату з джерельними даними.

Що зробити зараз

Reka AI Rho-1 доступна як дослідницьке превʼю, тож корисніша як стенд для перевірки гіпотез, ніж як основа продакшну.