Aleph Alpha випустила Kolibri-1, двомовну MoE-модель на 78,1B параметрів, яка на кожен токен активує лише 3,46B і приймає до 1 048 576 токенів контексту.
Білдерам у ЄС Kolibri-1 цікавий поєднанням ліцензії, заліза й комплаєнсу: Apache 2.0 дозволяє комерційне використання без переговорів про права, чекпойнт FP8 на 78 ГБ стає на один прискорювач, а пайплайн даних проєктували під GDPR, AI Act і General-Purpose AI Code of Practice. За даними MarkTechPost, модель цілиться в держуправління, промисловість і аерокосмічну галузь — сектори, де суверенне розгортання цінніше за лід у бенчмарках.
Скільки ресурсу потрібно на запуск Kolibri-1?
Kolibri-1 відправляє кожен токен до 6 із 384 експертів і додатково завжди вмикає один спільний експерт. Активними залишаються 3,46B параметрів, тобто 4,4% ваг, а баланс навантаження тримають Exact Quantile Balancing і Load-Error Injection.
Kolibri-1 поєднує 40 шарів зі sliding window і 10 шарів повної уваги. Шар зі sliding window дивиться лише на 512 попередніх токенів і тримає фіксований KV-кеш, тож із ростом контексту розширюються тільки 10 шарів. За однакового обчислювального бюджету така гібридна схема підтримує вчетверо довші послідовності, ніж модель із повною увагою в усіх шарах.
У форматі FP8 Kolibri-1 займає близько 78 ГБ і працює на одному B200, B300 чи H200 або на двох H100 SXM5 через vLLM. Aleph Alpha постачає для vLLM окремі парсери міркувань і виклику інструментів. Типове розгортання стартує з 262 144 токенів, а повне вікно в 1 048 576 потребує ще й перевизначення max_position_embeddings.
Що змінюється для німецькомовних продуктів?
Словник Kolibri-1 нараховує 128 000 токенів і зібраний методом UniBPE: він будує злиття як BPE, але оцінює кожне злиття за втратою Уніграми. На німецькому вебтексті модель кодує 4,90 байта на токен проти 4,35 у токенайзера GPT-5, тобто потребує на 11,2% менше токенів. В англійській різниця менша: 4,58 байта на токен проти 4,67.
Розробляли Kolibri-1 наскрізно команди в Німеччині, а навчання йшло на інфраструктурі в Німеччині та Фінляндії. Базове навчання охопило 20T токенів на 768 прискорювачах NVIDIA B200, далі йшли 3,44T токенів на довжині 65 536 і 201B токенів на послідовностях по 262 144 токени. Німецька становить понад 20% суміші, зокрема понад 2T токенів, які команда відібрала з вебу або згенерувала синтетично.
Kolibri-1 дозволяє задавати reasoning effort окремо для кожного запиту через chat_template_kwargs. Для RAG-сценаріїв важливий протокол Merlin-Arthur: модель вчать відмовлятися від відповіді, коли виданий контекст її не підтверджує. Пайплайн даних Aleph Alpha видаляє персональні дані ще до тренування.
Де Kolibri-1 виграє, а де програє?
В англійській Kolibri-1 отримала найкращі результати серед 12 порівнюваних MoE-моделей: GPQA Diamond — 84,3, AIME 2025 — 96,9, AIME 2026 — 96,0. Загальний бал становить 75,5 в англійській і 70,8 у німецькій. В агентських задачах англійською модель ділить першість із Qwen3.5 35B-A3B на 63,4.
Kolibri-1 програє у виклику функцій: на BFCL v4 вона набирає 61,4 проти 70,5 у Qwen3.5 35B-A3B. Щільна Qwen3.8 27B вища загалом — 80,2 в англійській і 79,9 у німецькій, але активує приблизно у 8 разів більше параметрів на токен. Порівняно з внутрішньою попередницею Kolibri Origin нова модель декодує приблизно у 2,7 раза більше тексту на один GPU і набирає на 21,4 пункта більше в англійській.
Що робити зараз?
- Прогніть німецькі промпти через новий токенайзер і порівняйте вартість інференсу з поточним провайдером на 1 000 типових запитів.
- Підніміть чекпойнт FP8 через vLLM на одному H200 або B200, увімкніть парсери kolibri1 і перевірте рекомендовані temperature 1,0, top-p 0,97 і top-k 128.
- Протестуйте Merlin-Arthur на своїй видачі: подайте документи без відповіді і виміряйте частку коректних відмов.
- Окремо заміряйте сценарії виклику функцій, бо саме тут Kolibri-1 програє Qwen3.5 35B-A3B.









