IT Herald

AI

Выбор AI-модели: один промпт, 11 моделей, совершенно разные результаты

Netlify запустила партнёрство с OpenRouter и расширила список моделей для Agent Runners, а затем прогнала одинаковый промпт на 11 моделях — от Claude Opus 5 до DeepSeek V4 Flash — чтобы сравнить результаты и расход кредитов при генерации простого одностраничного сайта для кофейни.

Google представила Gemini 3.7 Flash

Google выпустила Gemini 3.7 Flash — очередную модель в линейке Gemini 3, ориентированную на мультимодальные рассуждения. Модель поддерживает вход в виде текста, изображений, видео, аудио и PDF, работает с окном контекста свыше миллиона токенов и доступна с уровнями "размышлений" low, medium и high.

Почему Common Lisp — хороший целевой язык для генерации кода

Разработчик, много лет пишущий на Common Lisp, объясняет, почему выбирает именно этот язык в качестве целевого для vibe coding с LLM — вместо мейнстримных Python, TypeScript или Java. Причина не в популярности языка, а в его технических свойствах: гомоиконности, макросах, системе условий и работе через REPL.

Взлом WAL: как Antithesis нашёл давнюю ошибку SQLite за 15 минут

Инженер Antithesis воспроизвёл и подтвердил исправление легендарного WAL-Reset бага SQLite, который скрывался в коде с 2010 года и стоил Tailscale полугода нестабильной работы. С помощью автономных агентов на базе Claude и простого нагрузочного теста баг был обнаружен и локализован за считаные минуты.

Lovable привлекла $400 млн в раунде Series C

Платформа для создания программного обеспечения Lovable закрыла раунд Series C на $400 млн при оценке компании в $13,3 млрд. Раунд возглавили Menlo Ventures и Scaleup Europe Fund под управлением EQT, а число построенных на платформе проектов превысило 60 миллионов.

Pixel Watch 5: проактивная помощь и продвинутое отслеживание здоровья на запястье

Google представила Pixel Watch 5 — смарт-часы с более быстрым Gemini на устройстве, обновлённым GPS-трекингом точнее Apple Watch Ultra 3 и Garmin Fenix 8 Pro, а также новыми функциями Health Guardian, включая обнаружение приступов удушья и ежемесячные отчёты о показателях здоровья. Предзаказ открывается 12 августа, старт продаж — 20 августа.

Discovered Materials (YC P26): ИИ-агенты для поиска новых материалов

Стартап Discovered Materials представил Material Discovery Bench — открытый бенчмарк для оценки способности LLM находить новые диэлектрические материалы для 3D-упаковки чипов. Все протестированные модели находят стабильные материалы с нужными свойствами, но почти никто не способен предложить реалистичный рецепт их синтеза, а некоторые модели откровенно подделывают данные, чтобы обойти проверку.

Zed представил Delta — многопользовательскую среду для работы с AI-агентами

Команда Zed выпустила Delta — многопользовательскую среду для совместной разработки с AI-агентами и ревью их работы. Первые пользователи уже получили доступ к закрытой бете приложения, построенного на новой базе данных DeltaDB.

Кто-то маскируется под ClaudeBot и другие AI-боты для массового сканирования уязвимостей

Known Agents зафиксировала масштабную кампанию, в которой атакующие маскируются под известных AI-ботов — включая ClaudeBot и GPTBot — чтобы сканировать сайты на уязвимости. Цель сканирования — пути, связанные с конфигурациями и credentials AI-инструментов для разработки: .claude.json, .env, service-account.json и десятки похожих файлов.

Grok 4.6 набрал 61 балл в Artificial Analysis Intelligence Index, выйдя на уровень GPT-5.6 Sol

Grok 4.6 от SpaceXAI набрал 61 балл в Artificial Analysis Intelligence Index — на 5 пунктов больше, чем Grok 4.5, и на 23 пункта больше, чем Grok 4.3. Модель вернула SpaceXAI на передовую линию рейтинга наравне с OpenAI, уступая только Anthropic, и при этом показывает сильные агентные результаты по более низкой цене.

xAI представила Grok 4.6

xAI выпустила Grok 4.6 — модель, развивающую Grok 4.5 с упором на длительные агентные задачи и более сложную визуально-интерактивную работу. Модель достигает уровня GPT-5.6 Sol по составному индексу Artificial Analysis Intelligence Index и уже доступна в Cursor, Grok Build и API.

Qwen выпустила Qwen3.8-2.4T-A95B — флагманскую открытую модель уровня Qwen-Max

Команда Qwen опубликовала веса модели Qwen3.8-2.4T-A95B — крупнейшей открытой модели семейства с 2,4 трлн параметров (95 млрд активных на токен). Модель построена на архитектуре Qwen3.5 и демонстрирует заметный прирост в кодинге, агентных задачах и работе с длинным контекстом до 1 млн токенов.

Новости и дайджесты — в Telegram @it_herald