Экс-директор OpenAI отдала в паблик модель на 975B
Бум вокруг думающих ИИ-моделей продолжается. Команда Thinking Machines Lab представила свою первую и сразу флагманскую мультимодальную модель с открытыми весами — Inkling.
Разработчики сразу заявили: Inkling не пытается стать абсолютным лидером во всех бенчмарках среди открытых или закрытых систем. Ставка сделана на другое — дать разработчикам и бизнесу мощный, гибкий мультимодальный фундамент, который можно и нужно дообучать (кастомизировать) под свои специализированные задачи.
Inkling представляет собой Mixture-of-Experts (MoE) трансформер, во многом вдохновленный архитектурой DeepSeek-V3. В каждом MoE-слое используется 256 маршрутизируемых экспертов и 2 общих, при этом для каждого токена активируются 6 экспертов. Общий масштаб модели составляет 975 миллиардов параметров, из которых 41 миллиард являются активными. Для обучения использовался колоссальный датасет из 45 триллионов токенов, включающий в себя текст, изображения, аудио и видео.
Модель поддерживает окно контекста объемом до 1 миллиона токенов.
Особенностью архитектуры стал отказ от сторонних энкодеров для аудио- и визуальных данных. Звуковые сигналы поступают в систему в виде dMel-спектрограмм, а изображения кодируются как патчи 40x40 пикселей с помощью четырехслойного hMLP, после чего они обрабатываются совместно с текстовыми токенами через облегченный слой эмбеддингов.
За позиционное кодирование отвечают относительные позиционные эмбеддинги, которые в контексте длинных последовательностей показали себя лучше популярного решения RoPE.
В Inkling реализована функция контроля «мышления» (Controllable thinking effort), позволяющая разработчикам гибко настраивать глубину рассуждений модели непосредственно во время инференса. Это помогает существенно экономить
Читать на habr.com