ai-assistants

Grok 4.7, GPT-6 Astra, Claude и китайские модели, кто эффективнее?

Вчера SpaceXAI выложила Grok 4.7. За три недели до этого OpenAI выпустила GPT-6 Astra, Anthropic — Claude Fable 5.1. Ещё в июле рядом встал Claude Opus 5: сама Anthropic пишет, что для большинства задач включать надо его, а Fable доставать, когда Opus уже не тянет ваши замеры. Китайские лаборатории в этой компании больше не «дешёвый запасной аэродром». Qwen3.8 Max стоит те же $2 и $6 за миллион токенов, что и Grok, и на общем индексе отстаёт на один балл. Kimi K3 на суточных инженерных задачах сидит в том же коридоре, что и свежий Grok. Ниже один набор работ: длинный код, терминал, схемы, юридические дела и счёт. Цифры лабораторий и независимый прогон Artificial Analysis лежат отдельно. На Terminal‑Bench они расходятся почти в полтора раза. Спорить «кто первый» по одной картинке из анонса после этого бесполезно.

Читать далее →