Галлюцинации недели: Kimi K3, Inkling и Bonsai 27B, который можно запустить на своем iPhone
Пока весь топ-5 OpenRouter забирают китайские модели, Hy3, MiMo, DeepSeek V4 Flash, MiniMax M3 и GLM-5.2, платформа гоняет по 60 триллионов токенов в неделю. Логика пользователей при этом простая: сложно сравнивать бенчмарки, легко сравнивать счета.
Moonshot AI выложила Kimi K3, и это самая большая open weight модель в истории: 2.8 триллиона параметров, миллион токенов контекста. Веса обещают 27 июля, а пока доступ через API по цене $3/$15, ровно как у Sonnet 5. Artificial Analysis намерила 57 по Intelligence Index (сводный балл интеллекта): выше, чем Opus 4.8 (56), ниже, чем Fable 5 (60) и GPT-5.6 Sol (59). На Frontend Code Arena, где люди вслепую сравнивают сгенерированные интерфейсы, K3 встала на первое место с 1679 очками, обойдя и Fable 5, и GPT-5.6 Sol. Впервые Китай возглавил этот лидерборд.
Архитектурно интереснее всего Kimi Delta Attention: механизм, который держит фиксированную обученную память на каждый запрос вместо того, чтобы честно пересчитывать всё внимание по миллионному контексту. Отсюда обещанные до 6× по скорости декодинга на длинных контекстах и цена, которая почти не растёт с длиной. Стоимость решённой задачи Artificial Analysis оценила в $0.94 против $1.80 у Opus 4.8. Модель выигрывает Program Bench и SWE Marathon, то есть держит длинные многочасовые сессии, а не только короткие задачки.
Сама Moonshot признаёт заметный разрыв в пользовательском опыте с Fable 5 и GPT-5.6 Sol. Уровень галлюцинаций на AA-Omniscience подрос до 51% с 39% у прошлой K2.6, модель многословная, медленная (около 28 токенов в секунду через API) и живёт на постоянном режиме max thinking. И open weight не значит "дёшево запустить": 2.8T даже в 4-битной упаковке весит около 1.4 ТБ, Moonshot советует ставить от 64 ускорителей.
Читать на habr.com
