IT Herald

AI

Бенчмаркопокалипсис

LLM-агенты сделали накрутку результатов бенчмарков почти бесплатной: то, что раньше требовало недель работы опытных инженеров для взлома тестовых наборов вроде SPEC, теперь достигается парой промптов. На примере регекс-движка FRE, написанного агентом за месяц, разбирается, как переобучение под бенчмарк маскирует реальную (и куда более скромную) производительность.

Google купила на аукционе данные обанкротившейся авиакомпании Spirit — ради AI

Google приобрела за $10 млн массив обезличенных данных обанкротившейся авиакомпании Spirit Airlines — свыше 100 миллионов писем, 30 миллионов записей звонков в службу поддержки и данные из Teams, Oracle и SAP. Компания заявила, что использует их для улучшения своих AI-сервисов.

Израиль создал фиктивный аналитический центр, похоже, чтобы обмануть ИИ-чатботов

За чуть больше недели новый «Институт Ганновера» опубликовал свыше 100 материалов об Израиле и Палестине, структурированных так, чтобы их охотно цитировали ИИ-чатботы вроде ChatGPT, Gemini и Claude. Расследование показало, что организация создана по заказу израильского правительства и не имеет отношения к настоящей аналитике.

Журналисты проследили за партией редких книг — она оказалась на объекте Amazon для обучения ИИ

Издание 404 Media проследило за партией редких книг, вложив в неё GPS-трекер, и выяснило, что книги оказались на складе Amazon в Лас-Вегасе. Там сотрудники срезают переплёты и сканируют страницы для получения данных для обучения ИИ, после чего печатные экземпляры уничтожаются.

AirTag выявил, что Amazon уничтожает редкие книги для обучения ИИ

Скрытый в редкой книге AirTag привёл журналистов 404 Media на склад Amazon в Лас-Вегасе, где книги вырывают из переплётов и сканируют для обучения ИИ-моделей, после чего уничтожают. Компания подтвердила закупку книг «через коммерческие каналы», но не стала комментировать связь с обучением ИИ.

AI;DR (AI; не читал)

Новый акроним AI;DR — по аналогии с TL;DR — набирает популярность как реакция на волну неотредактированных текстов, сгенерированных нейросетями. Идея проста: если автор не потрудился вычитать и отредактировать вывод ИИ, читатель тоже не обязан его читать.

Qwen3.8 27B набрала 52 балла в индексе Artificial Analysis

Модель Qwen3.8 27B от Alibaba набрала 52 балла в Artificial Analysis Intelligence Index, значительно опередив медиану сопоставимых открытых моделей (9 баллов). Модель выпущена под лицензией Apache 2.0, поддерживает текстовый и графический ввод, а также контекстное окно на 256 тысяч токенов.

Как отключить или избежать навязчивого ИИ в популярных приложениях

Опубликовано пошаговое руководство по отключению встроенных функций ИИ в Adobe, Windows, Android, браузерах, Google Workspace, Slack, WhatsApp, Zoom и других сервисах, где такие функции появляются без явного запроса пользователя.

ИИ-«автофикс» GitHub Copilot открыл доступ к Jira компании Snowflake

Автономный ИИ-инструмент Wiz Research «Red Agent» обнаружил критическую уязвимость в GitHub Actions workflow одного из публичных репозиториев Snowflake. Уязвимость была внесена всего за пять дней до обнаружения коммитом, соавтором которого выступил Copilot Autofix — ИИ-ассистент удалил безопасный паттерн обработки входных данных и заменил его прямой подстановкой строк в shell-скрипт, что позволило похитить токен доступа к Jira Snowflake.

GPT-5.6 Sol — лучшая «зрячая» модель из всех, что выпускала OpenAI

Roboflow протестировала новые модели OpenAI — GPT-5.6 Sol, Terra и Luna — на собственном бенчмарке компьютерного зрения, включающем детекцию, подсчёт объектов, OCR и извлечение данных. Sol показала резкий скачок в детекции и подсчёте по сравнению с GPT-5.5, хотя по-прежнему уступает Gemini 3.5 Flash по соотношению цены и качества.

MathCode: агент для автоматизации математических доказательств на Lean 4

Представлен MathCode — терминальный AI-ассистент для программирования со встроенным движком математической формализации: математическая задача на естественном языке автоматически превращается в теорему Lean 4 с попыткой формального доказательства.

Аргументы против формальной верификации спустя 50 лет

Инженеры вновь заговорили о формальной верификации софта — интерес к теме резко вырос на фоне распространения ИИ-агентов для написания кода. На этом фоне стоит перечитать классическую статью 1979 года «Social Processes and Proofs of Theorems and Programs», где авторы доказывали бесперспективность полной верификации программ, и проверить, какие из их аргументов выдержали проверку временем.

Новости и дайджесты — в Telegram @it_herald