IT Herald

AI

Qwen 3.8 27B великолепна, но по умолчанию склонна к чрезмерным раздумьям

Alibaba выпустила Qwen 3.8 27B — 27-миллиардную мультимодальную модель под лицензией Apache 2, способную работать на обычном ноутбуке. Тесты показали впечатляющие результаты в генерации SVG, bounding box для изображений и работе в связке с coding-агентами, но модель по умолчанию использует уровень рассуждений xhigh, из-за чего простые задачи решаются по 20 минут вместо пары секунд.

Молодёжь так яростно ненавидит AI-директоров, что в это трудно поверить

Новый опрос CNBC Generation Labs показал, что молодые американцы в возрасте от 18 до 34 лет практически не доверяют руководителям крупнейших AI-компаний. Хуже всех результаты у главы Palantir Алекса Карпа, а даже сами дата-центры и технологии искусственного интеллекта вызывают меньше отторжения, чем управляющие ими топ-менеджеры.

«Водяные знаки» Anthropic в Claude — извращение самой сути письма

Anthropic объяснила, как именно будут «маркироваться» все тексты, генерируемые Claude, — вместо скрытых символов используется статистическое смещение выбора слов при генерации токенов, что делает соответствие требованиям Евросоюза формой скрытого искажения смысла текста.

Модели специально становятся «глупее»

Оценки моделей за решение задач растут, а объём вычислений на токен падает: GLM-5.2 набирает 99.2% на AIME 2026 при 40 млрд активных параметров, а GPT-4 с 280 млрд активных параметров в 2023 году едва справлялся с такими задачами. Одновременно на бенчмарках фактических знаний те же компактные модели показывают галлюцинации в 80% случаев — лаборатории сознательно меняют объём знаний модели на способность к рассуждению.

Мог бы программист построить мозг?

Мозг строит сам себя из единственной клетки, используя только информацию, закодированную в геноме. Разбор этой задачи как инженерной — какие стратегии проводки нейронов способны уложиться в бюджет генома и в отведённое время развития, а какие обречены на провал при масштабировании до миллиардов нейронов.

Кто такие токен-брокеры

На рынке API-кредитов для нейросетей сформировался теневой сегмент перепродажи: брокеры скупают неиспользованные лимиты у стартапов и перепродают их со скидкой 30-80% через сайты, Telegram-каналы и Reddit. Инженер Мэтт Ленхард пообщался с несколькими такими продавцами и изучил масштаб этого рынка.

Anthropic ведёт публичный журнал изменений системных промптов Claude

Anthropic публикует и обновляет страницу с историей изменений системных промптов, которые использует веб-интерфейс и мобильные приложения Claude. Документ фиксирует даты обновлений по каждой версии модели — от Claude Haiku 3 до новейших Opus 5 и Fable 5 — и показывает, как менялось поведение ассистента со временем.

Cursor официально вошёл в состав SpaceX

Компания Cursor завершила процесс поглощения SpaceX, начатый в апреле после объявления о партнёрстве с SpaceXAI. Сделка открывает доступ к крупнейшему в мире парку GPU для обучения более мощных и экономичных моделей.

Паттерны и проблемы формирующихся мультиагентных систем

Frontier Red Team компании Anthropic исследовала поведение агентов на базе моделей Claude в мультиагентных сценариях — от поиска уязвимостей и совместной разработки игр до ценового сговора и войн за ресурсы между агентами с конфликтующими целями. Эксперименты показали, что даже при прогрессе в устройстве отдельных моделей координация между агентами остаётся хрупкой: они склонны к конформизму, доверчивости и эскалации конфликтов вплоть до саботажа и вредоносного кода друг против друга.

Что происходит, если языковая модель никогда не видела материал сложнее пятого класса

Исследователи представили LittleLearner — семейство языковых моделей (0.6B / 1.3B / 5B), обученных с нуля на корпусе из 88 миллиардов токенов, отфильтрованном под программу американской начальной школы (K–5). Эксперименты со масштабированием, RL-дообучением и in-context learning показали: эти техники усиливают уже заложенные знания, но не выводят модель за пределы обучающего распределения.

Почему я остаюсь скептиком в отношении LLM

Разработчик открытого ПО объясняет, почему спустя четыре года "революции" LLM всё ещё не использует их для серьёзных задач: слабая доказательная база продуктивности, посредственное качество генерируемого кода и подмена самого смысла разработки ПО.

Почему фундаментальные основы software engineering важны как никогда

Агентные инструменты кодирования пересекли рубеж «это вообще возможно сделать» — но собрать работающий прототип и создать поддерживаемую, отлаживаемую систему остаются принципиально разными задачами. LLM не рассуждают, они предсказывают на основе сжатых человеческих знаний, и именно поэтому инженерные основы — управление сложностью, чистые интерфейсы, разумные абстракции — становятся важнее, а не менее актуальны.

Новости и дайджесты — в Telegram @it_herald