Liquid AI випустила дві відкриті decision-моделі Open d1: d1-3B з 3,12 млрд параметрів і d1-omni-600M з 587 млн параметрів, які повертають відповідь без жодного згенерованого токена.
Це знімає з білдера парсинг тексту й очікування потоку токенів. Один виклик закриває роутинг, модерацію чи оцінку, а цільова платформа охоплює сервери NVIDIA DGX, робочі станції RTX і плати Jetson. За даними MarkTechPost обидва чекпоїнти вже лежать на Hugging Face, завантажуються через Transformers і мають підтримку llama.cpp з дня релізу.
Чим decision-модель відрізняється від генеративного LLM?
Генеративний LLM пише відповідь токен за токеном, а код потім розбирає текст. Модель Open d1 від Liquid AI приймає стан і набір іменованих запитань, читає їх за один прохід і повертає калібровану типовану відповідь — ймовірність для кожної дозволеної відповіді. У кожній відповіді поле output_tokens дорівнює 0.
Liquid AI описує три типи запитань: noul — питання з відповіддю так чи ні, яка повертається як P(yes); choice — один label з іменованих опцій із повним розподілом ймовірностей; score — ймовірнісно зважена позиція на впорядкованій шкалі від 2 до 10 рівнів.
Кілька запитань можуть спиратися на один стан в одному виклику. Liquid AI радить d1 для роутингу, модерації, класифікації намірів, переранжування, оцінки в стилі LLM-as-a-judge, гардрейлів агентів і візуальної інспекції. Жоден із двох чекпоїнтів не працює як чат-модель.
Як влаштовані d1-3B і d1-omni-600M?
Модель Liquid AI d1-3B має 3,12 млрд параметрів і стартує з LFM2.5-VL-3B — декодерної візійно-мовної моделі. Команда усереднила ваги LFM2.5-2.6B із текстовим бекбоном цієї моделі, дотренувала кілька чекпоїнтів із різними seed і сумішами даних та знову їх обʼєднала. Візуальний енкодер — SigLIP2 NaFlex на 400 млн параметрів, контекст — 32 768 токенів.
За словами команди, довгі входи, перемішані варіанти відповідей і усунення коротких шляхів у даних дали більше, ніж передові техніки.
Модель Liquid AI d1-omni-600M має 587 млн параметрів і стартує з LFM2.5-Encoder-350M, двонапрямленого енкодера. Спільний стовбур і голова рішень займають 381 млн параметрів, візуальний енкодер — 94 млн, аудіоенкодер — 112 млн. Аудіоенкодер має 17 шарів FastConformer, контекст становить 16 384 токени, а довжина аудіокліпу обмежена 30 секундами.
В один запит потрапляє або зображення, або аудіо, але ніколи обидва формати разом. Аудіонавчання охоплювало лише англомовні звернення від мовця до асистента.
Наскільки точні й швидкі моделі Liquid AI?
На Decision Index v0.2.1 модель Liquid AI d1-3B набирає 48,57 бала — найкращий результат серед моделей до 10 млрд параметрів. Вона обходить Decider 35B-A3B із 47,11 бала, а вище залишається лише Winnow-12B із 50,02 бала. Офіційний скорер проганяв сам Liquid AI, тож оцінки d1 не є заявками в лідерборд. Модель веде в категоріях Tools (74,5) та Arts (36,3), але відстає в Knowledge (23,8).
На семи публічних текстових бенчмарках Liquid AI d1-3B в середньому набирає 82,9 бала проти 81,1 бала в Decider 4B. Модель d1-omni-600M в середньому має 78,4 бала і показує найкращі результати на Civil Comments (95,8) та PAWS-X (79,5). На 11 зображувальних бенчмарках d1-3B дає в середньому 74,1 бала проти 73,9 у своєї базової моделі, а аудіобенчмарки для decision-задач Liquid AI називає відкритою проблемою.
Liquid AI d1-3B відповідає на одне запитання за 8 мс на RTX 4090 — це наскрізна затримка за вимірювання з одним прогрітим запитом за раз. На AMD MI325X вона становить 9 мс, на Jetson AGX Thor — 16 мс, на Jetson AGX Orin — 26 мс, на Orin Nano — 50 мс. Три запитання над одним станом на Jetson AGX Thor займають 20 мс проти 16 мс для одного. Цифру для RTX 4090 отримано з model.compile(mode="reduce-overhead"), без якого одне запитання займає 16 мс.
Модель d1-3B читає зображення 384 px за 35 мс на Jetson AGX Thor, а простір Open d1 Arcade запускає її покадрово на живому відео з камери для модерації контенту та керування жестами. Для d1-omni-600M опублікованих цифр затримки немає: це ранній дослідницький реліз.
Що робити зараз
Liquid AI постачає d1 як готові чекпоїнти для роутингу, модерації та гардрейлів агентів на стеку NVIDIA.
- Підніміть Liquid AI d1-3B з Hugging Face через Transformers: потрібні transformers>=5.14 і trust_remote_code=True, для d1-omni-600M — transformers>=5.15. Для одного стану викликайте system_one(state, questions), для пакованих запитів — system_one_batch.
- Протестуйте один виклик на три задачі тріажу: перевірка повернення так чи ні, вибір команди-власника та оцінка терміновості. Для голосу додайте до 30 секунд аудіо в d1-omni-600M й отримуйте намір мовця напряму.
- Перевірте ліцензію LFM Open License v1.0: безкоштовне комерційне використання діє до $10 млн річного доходу. Запускайте d1-omni-600M на GPU у float16, бо bfloat16 змінював частину топових відповідей, і прогоніть десять камерних демо в Open d1 Arcade.








