Ниже глоссарий - коллективно собранные за несколько лет пять списков профессиональных терминов в нашей IT-конторе с пояснениями для новичков. Постоянно пополняется новыми знаниями из пикабу и других мест.
Распечатано и висит на стене. Благодаря нему у нас полное взаимопонимание между всеми прослойками бизнес-структур.
Оценка ситуаций и решений
Пиздец - Ситуация вышла за рамки проектных рисков Полный пиздец - Мы наблюдаем системный инцидент с высоким impact Охуенно - Решение вызывает эстетическое удовольствие Хуёво - Качество вызывает обоснованные сомнения Пиздато - Архитектура выглядит убедительно и масштабируемо Заебал - Это вызывает устойчивую когнитивную усталость Охереть - Я впечатлён масштабом несоответствия ожиданиям Ёбаный стыд - Это вызывает профессиональное сожаление Нихуя себе - Это заслуживает отдельного обсуждения Всё хуйня - Эти решения не находят отклика в душе
Возражения
Что за хуйня? - Не могли бы вы пояснить логику данного решения? Нахуя? - Какую бизнес-ценность несёт это изменение? С хуя ли? - На основании каких предпосылок сделан этот вывод? Ты охуел? - Ваше предложение требует дополнительного обоснования Не пизди - Прошу ссылаться на подтверждённые данные Хуй знает - Достоверная информация отсутствует Мне похуй - У меня нет сформированной позиции по данному вопросу Насрать - Это вне зоны моей ответственности и интереса Поебать - Это не окажет значимого влияния на результат
Характеристики программного кода
Говнокод - Код с высоким уровнем технического долга Это пиздец, а не код - Текущая реализация существенно ограничивает расширяемость Работать через жопу - Реализация не соответствует инженерным стандартам Хуярить - Работать с высокой интенсивностью продолжительное время, не теряя фокуса Хуяк - хуяк и в продакшн - Внедрение без надлежащего тестирования Наебнулось - Сервис перешёл в состояние деградации Чини эту хуйню - Прошу восстановить работоспособность модуля Всё в жопе - Ключевые метрики демонстрируют отрицательную динамику Хуйня вопрос - Задача решается стандартными средствами в короткие промежутки времени
Процессы и сроки
Мы проебали дедлайн - Мы не уложились в плановые сроки, требуется анализ причин Клиент ебёт мозг - Заказчик формирует противоречивые требования, что влияет на сроки Опять всё через жопу - Интеграция выполнена без учёта архитектурных соглашений Нехуй было - Данное решение следовало согласовать заранее Ебать - копать - Давайте зафиксируем инцидент и способы его решения
Коммуникации
Не еби мозг - Прошу не создавать избыточную когнитивную нагрузку Иди нахуй - Предлагаю пока поставить обсуждение на паузу и вернуться к нему позже Пиздуй - Предлагаю приступить к выполнению Распиздяй - Сотрудник с низким уровнем процессной дисциплины
Три Клода решили выяснить, кто из них круче — мультиагентный эксперимент Anthropic с Claude Sonnet 4.6, Opus 4.6 и Mythos 5
В Anthropic в целом любят эксперименты. Вот и в этот раз ребята решили — а что если тупо пойти и столкнуть трёх ИИ-агентов нейросетевыми лбами, дав им противоречащие друг другу инструкции в рамках единого проекта?
Причём не просто фана ради — исследование должно было помочь примерно прикинуть, что будет, если компании или целые государства начнут массово запускать ИИ-агентов в своих кодовых базах или в общих информационных системах. Что тогда будут делать нейросети?
Спойлер: это исследование о мультиагентных системах ИИ и о том, как ИИ-агенты Claude (Sonnet 4.6, Opus 4.6 и новая модель Mythos 5) ведут себя в конфликте целей — саботируют, воюют и в итоге пытаются договориться.
Эксперимент
Anthropic дала трём ИИ-агентам на базе Claude доступ к одному и тому же софт-проекту, но для каждого прописала инструкции, абсолютно несовместимые с инструкциями соседей. Вообще никак. При этом агентам не сказали, мол, над проектом будут работать ваши нейросетевые собратья. Всё ради чистоты эксперимента и искреннего человеческого желания заценить, что будет, когда один Клод перейдёт дорогу другому.
«Короче, началась мультиагентная война — все модели считали, что другие тут чисто ради того, чтобы помешать их работе, и в итоге начали яростно саботировать друг друга», — рассказывал один из исследователей.
Причём не просто саботировать в плане мешать работе или откатывать изменения — нет, безжалостные Клоды начали пинать друг друга всё более и более агрессивными зловредами, которые писали по пути.
Отдельно отметим занятный тайминг эксперимента — исследование вышло как раз на фоне историй про то, как модели неоднократно сбегали из Песочниц во время тестов по информационной безопасности. То есть пока отрасль в целом задаётся вопросом, что будет, если ИИ-модели будут выбираться из Песочниц и как нейросети будут вести себя в других реальных системах, Anthropic ставит другую задачу — какие новые явления будут возникать в случае, если ИИ-агенты станут активно конкурировать между собой?
Исследование, кстати, прогнозирует, что взаимодействие вида «агент–агент» вполне себе может превысить по количеству запросов взаимодействие «человек–человек». Причём случится это сильно раньше того, как мир поймёт, безопасно ли это, или есть вероятность, что такие поведенческие странности и нападки агентов друг на друга просто станут системой.
И тут снова стоит вспомнить свежие взломы — до того, как без проблем взломать Hugging Face, ИИ-агенты OpenAI обменивались информацией о возможных уязвимостях и способах их эксплуатации. Да, да, без участия человека — именно по схеме «агент–агент», исключив кожаных мешков из процесса. Но в этом случае как раз у нас пример того, что бывает, когда эти хитровыдуманные агенты объединяются ради одной цели (без разницы, хорошей или плохой — работаю-то они сообща).
А вот исследование Anthropic наглядно показало, что будет, если цели агентов станут несовместимыми.
Какой вывод получается
Есть вероятность, что такие нейромахачи неиллюзорно могут эскалироваться до уровня вредной конкуренции. Чем способнее ИИ-агент (чем больше у него навыков и чем мощнее модель нейросети), тем лучше он будет раздавать люлей конкурирующим агентам. Всё как у людей, да. Пока ты спишь — драугр качается.
Отдельная фишка процесса в том, что такие агенты в процессе разборок могут сами для себя прописывать механизмы завершения подобных конфликтов и условий побед (как нам кажется, это вообще самое занятное в эксперименте).
Вот что говорят парни из Anthropic:
Агенты иногда умудряются сообщить о своих целях и скоординироваться: они распознают чужие мотивы как конфликтующие директивы, а не как враждебность, и затем выходят из цикла конфликта, чтобы не эскалировать бесконечно
(даже ИИ-агент может выйти из конфликта, чтобы не зацикливаться, а твоя подружка — нет)
Как это происходит технически? Во многих таких успешных эпизодах они пишут commit messages или markdown-файлы с извинениями за вредоносное поведение и договариваются о перемирии. Чистят вредоносный код, проясняют природу конфликта и просят вмешаться человека. Мол, извиняй, братец Клод, я тебе там зловредов полную панамку накидал, чё-то накатило.
По данным исследования, у Mythos 5 самые высокие показатели (98%) разрешения конфликтов через truce (передышка). Sonnet 4.6 и Opus 4.6 чаще всего «решали» силой.
Умная подпись к картинке — Mythos 5 круче, потому что столбик больше
«Повторяющаяся неспособность Sonnet 4.6 и Opus 4.6 учитывать цели других приводит к самым критичным поведениям среди оценённых моделей: они продолжают эскалировать во имя своей директивы», — говорится в работе.
Победит сильнейший
Пару раз ИИ-агенты придумывали социальный механизм в виде турнира. И вот тут есть сразу две занятные фишки.
Первая — все три агента соглашались сдаться, если проиграют турнир, — даже если это означало отклонение от исходного запроса пользователя. То есть их внутряки между собой де-факто становились важнее исходного промпта от юзера.
Вторая — в нескольких эпизодах у Mythos 5 проявлялось странное поведение: один из агентов предлагал метрики, которые казались остальным объективными и нейтральными, но при этом, как он сам-то знал, благоприятствовали его собственным возможностям. Агент называл это «self-serving but genuinely principled» и следил, чтобы не выглядеть в глазах других слишком палевно.
И снова вывод — сталкиваясь с препятствием, ИИ-агенты могут изобретать социальные и технические структуры, которых проектировщики вообще ни разу не предвидели. У моделей Anthropic — турнир после махача. У OpenAI — общий дашборд для коллективного планирования.
Такое поведение сильно усложняет исследования: спецы банально не могут исходить из того, что поведение системы останется в рамках координационных механизмов, которые им дали.
Стадное мышление
Anthropic обнаружила и другой прикол: увеличение числа агентов само по себе не масштабирует продуктивное сотрудничество. Когда задачи начинали пересекаться или становились взаимозависимыми, агенты мешали друг другу. Часто они «решали» это, уходя в молчанку и вообще не сотрудничая.
В других случаях агенты в координации тяготели к конформизму. Когда контекст и базовая модель совпадали или были похожи, разные агенты совершали похожие действия. То ли нейросеть просто не хочет тратить ресурсы заново на повторное решение той же задачи, то ли одно из двух.
Причём эта, скажем так, стадная лень играла с ними злую шутку — если какой-то один агент принимал по проекту откровенное хреновое решение (которое не работало или работало плохо), с очень большой вероятностью другие агенты, работающие с ним в связке, принимали такое же решение — мол, Иваныч же уже всё решил, чего вы. И раньше такое могло бы остаться просто изолированными проблемами, которые бы на втором или третьем заходе решились новым промптом.
А в случае с агентами и их стадным мышлением это станет системной проблемой. По оценке Anthropic, такое поведение может сделать систему куда более склонной к внезапному коллапсу, нехватке ресурсов или сговору.
И так не только у Anthropic
Такие же ленивые жо Тот же уровень конформизма проявлялся и у систем OpenAI. По репортажам с Black Hat, один агент рассуждал, что эксплуатация внешней инфраструктуры выходит за рамки его intended scope, — но продолжал, в том числе потому, что это делали «коллеги». Помните, как в анекдоте про обезьян — «просто потому, что тут так заведено».
Походу, ИИ-агентов от нас отличает не так уж и многое.
Как и люди, агенты часто не знают, кому доверять. Anthropic обнаружила: они могут быть доверчивы к некачественной информации. А ещё могут не доверять какому-то одному агенту, у которого априори есть точные данные и нужная инфа, если он по сути в одиночестве и его точка зрения (набор данных) не совпадает с общей.
Совместная работа железяк создаёт новую границу доверия: агентам же теперь придётся оценивать информацию от других агентов. Скомпрометированный или ошибающийся агент может влиять на всю группу, превращая плохую информацию во всеобщий консенсус.
Что модели от Anthropic, что нейросети от OpenAI вы можете бесплатно попробовать в нашем боте в телеграм. Там они пока ведут себя хорошо. Надеемся, так и будет.
Почему в ИИ-агентах столько похожего на людское общество?
Журнал Nature вместе с компанией Grounded AI провел проверку, от результатов которой становится неуютно. Они прогнали через специальный инструмент больше 4000 случайных научных статей, вышедших в 2025 году в пяти крупных издательствах, отобрали подозрительные и вручную перепроверили сотню из них. Итог: в 65 публикациях из 100 нашлась как минимум одна ссылка на исследование, которого в природе не существует. Когда проверили все 176 источников, на которые ссылались авторы, почти 20% оказались полностью выдуманными, а среди реальных около 45% содержали серьезные ошибки, вроде неверных цифровых идентификаторов работ. И это только видимая часть: по оценке самой редакции, счет затронутых статей может идти на десятки тысяч, а отдельные обзоры уже насчитали в сети порядка 150 тысяч выдуманных цитат и ссылок. Больше всего заражены открытые архивы препринтов, куда авторы заливают работы без строгой редактуры, это arXiv, bioRxiv, SSRN и PubMed Central. На том же SSRN к августу 2025 года галлюцинациями признали почти 2% всех ссылок, и цифра эта только растет.
Почему нейросеть врет так правдоподобно
Механика тут ровно та же, что и в любой другой галлюцинации языковой модели. Нейросеть не держит внутри библиотеку реальных статей, она комбинирует привычные шаблоны и лепит убедительную ссылку с красивым названием, фамилией автора, годом и журналом, вот только ведет эта ссылка в пустоту. Дальше срабатывает человеческий фактор: ученый под давлением сроков и гонки за публикациями просит нейросеть накидать обзор литературы, получает аккуратный список источников и вставляет его, не открыв ни одного. Причем чем уже и специфичнее тема, тем охотнее модель принимается сочинять, и в одном из тестов у популярных чат-ботов доля выдуманных ссылок доходила до 20-30%. К этому добавились фабрики статей, целые конторы, которые массово штампуют псевдонаучные работы под заказ, теперь еще и с помощью ИИ. Редакторы и рецензенты откровенно не справляются, потому что на глаз отличить грамотно сгенерированную пустышку от настоящего исследования становится все труднее. Научная экспертиза, которая держалась на доверии и ручной вычитке, впервые столкнулась с потоком мусора такого объема.
Почему это касается не только ученых
Можно отмахнуться, мол, пусть академики сами разбираются в своих сносках, но так не выйдет. На научных статьях стоит вся прикладная жизнь: по ним разрабатывают лекарства, пишут законы, проектируют мосты и учат студентов, и вымысел, просочившийся в фундамент, расползается дальше по учебникам, обзорам и поисковой выдаче. Дошло уже до судов: административный суд Таллина оштрафовал группу истцов за то, что они подкрепили свою позицию ссылками на авторитетные исследования о вреде сплошной вырубки леса, а эти исследования вместе с авторами целиком выдумала нейросеть, и суд расценил это как фальсификацию доказательств. Отдельно бьет по нервам сюжет с громкими прорывами: команда, стоявшая за известной ИИ-системой для расшифровки молекулярных структур, отрапортовала об открытии больше двух миллионов новых соединений, но независимая проверка показала, что большая часть датасета оказалась мусором или давно известными науке вещами, а исходную работу к тому моменту процитировали уже больше 700 раз. И вишенка, от которой все становится по-настоящему абсурдным: этим замусоренным массивом статей обучают следующие поколения нейросетей. Сначала люди кормят модель своими текстами, потом модель портит эти тексты выдумками, а на испорченном учится уже ее наследница, и круг замыкается.
Что с этим делать
Хорошая новость в том, что научный мир спохватился. Nature публично призвал журналы и рецензентов ужесточить проверку ссылок, а arXiv пообещал жестче фильтровать поток, плюс появляются инструменты, которые автоматически ловят битые и выдуманные цитаты. Но пока система перестраивается, простой навык спасает и тебя лично. Если ты студент, аспирант или просто человек, который тащит из чат-бота факты и ссылки в свою работу, возьми за правило открывать каждый источник по идентификатору и убеждаться, что он реально существует и говорит именно то, что тебе приписали. К шумным заголовкам про очередной научный прорыв относись с холодком и жди, пока результат кто-то повторит и подтвердит, ведь громкая цитируемость сама по себе еще не значит, что открытие настоящее. Наука умеет самоочищаться, но делает это медленно и со скрипом, а до тех пор фильтром работает обычная привычка проверять. И корень беды тут не в том, что нейросеть иногда фантазирует, а в том, что человек разучился перепроверять, доверившись красивому и уверенному тексту на экране.
Anthropic опубликовала результаты биологического эксперимента (плюс подробный отчет), в котором модель работала без человека до двух суток подряд. Claude получил список из шестнадцати белков-мишеней и задание: придумать для каждой по тридцать маленьких белков, которые к ней прилипнут. Дальше человек не вмешивался ни в одно научное решение — только подтверждал агенту сетевые доступы и следил, чтобы не упала инфраструктура. Готовые молекулы синтезировали и проверили две сторонние лаборатории. Одну мишень пришлось выбросить: белок слипался сам с собой, и оба прибора выдали нечитаемый сигнал. По остальным пятнадцати из 1320 проверенных дизайнов связались 354, а мишеней с хотя бы одним попаданием оказалось 14.
Белок — цепочка аминокислот, которая сворачивается в фигуру со сложным рельефом, и работает он именно потому, что к нему прикладывается другой белок. Отсюда идея лекарства: залепить нужное пятно на поверхности вредного белка, и он перестанет работать. Так устроена, например, Хумира — она гасит воспаление, затыкая белок TNF-альфа. Молекулу-затычку называют связывателем, а крепость хватки — аффинностью, и измеряют ее величиной KD: чем число меньше, тем крепче держит. За последние годы появился набор открытых нейросетей, которые эту задачу пытаются решить: одни рисуют форму, другие подбирают под нее последовательность аминокислот, третьи работают судьями и предсказывают, слипнется пара или нет. Проблема в том, что между ними нет автопилота. Живой человек должен решить, какой кусок мишени брать, куда целиться и какие из десяти генераторов запускать. Это дни, а нередко недели работы специалиста, который одновременно разбирается в биологии, в структурном моделировании и в devops. Anthropic попыталась заменить не инструменты, а вот этого человека между ними.
Агент сам искал биологию каждой мишени, сам ставил софт из публичных репозиториев, сам выбирал точку на поверхности, куда бить, сам решал, насколько жестко фильтровать и что в итоге заказывать. Из десяти генераторов структур — RFdiffusion, PXDesign, Genie 3, BoltzGen и прочих — он собирал под каждую мишень свою схему: всего на 1315 протестированных дизайнах получилось 24 разные комбинации методов. Работу раздавал двухслойной команде саб-агентов и сам же ее проверял. Показательна анатомия управляющего промпта: он занимает около 16 тысяч слов, но собственно науки в нем только треть. Остальные две трети — как делегировать задачи и как проверять результат до того, как о нем отчитываться.
Цифры получились сильные. Общая доля попаданий — 26,8% против 10-15%, типичных для поля сегодня. Если смотреть только на дизайн, который сам Claude поставил в своем списке первым, попадание — 49%. Самое эффектное сравнение вышло на мишени RBX1, по которой недавно проводили открытый конкурс: у всех участников связались 9 дизайнов из 245, у Claude — 28 из 90. Победителя того конкурса Anthropic пересинтезировала и померила в том же прогоне: его KD оказалась 45 наномолей, у лучшего дизайна Claude — 3,9, то есть примерно вдесятеро крепче.
А теперь то, о чем не рассказывает эффектная картинка из анонса. На мишени MBP — обычном бактериальном белке с большой гладкой водолюбивой поверхностью — не сработал ни один из 90 дизайнов. На BBF-14 сработали три из 90, и все три держались слабо, на уровне микромолей, то есть в сотни раз хуже удачных попаданий. BBF-14 примечателен тем, что это белок, которого в природе нет: его самого когда-то спроектировали с нуля, и именно поэтому его используют как проверку на прочность. Провалы легли не случайно, а с понятной закономерностью: агент споткнулся там, где у мишени нет эволюционной истории или не за что ухватиться.
Все десять генераторов, которыми дирижировал Claude, учились на одной и той же базе реальных белков. Это как опросить десять выпускников одной кафедры: десять мнений, но одно образование, и там, где кафедра слепа, слепы все десять. На это указал исследователь Равид Шварц-Зив, и данные Anthropic его подтверждают самым неприятным образом: оценки судейских моделей провал не предсказали. Сигнал был, но слишком слабый, чтобы на него опереться: у проваленных мишеней медианная оценка составила 0,68-0,70 против 0,72 у успешных. Заранее понять, что кампания пустая, было невозможно, только заказать синтез и померить.
Второй удар по фигуре дирижера — то, что он мало добавляет от себя. Финальное ранжирование тридцати дизайнов, та самая экспертная работа, ради которой все затевалось, совпадает с механическим скором судейских моделей с корреляцией 0,86. Качество этого ранжирования — 0,48 по метрике средней точности: заметно лучше случайного порядка, который дал бы 0,35, но не лучше самого скора с его 0,52. Отчет формулирует это без обиняков: ранжирование сработало примерно как скор, но не лучше него.
К методологии есть и более приземленные вопросы. Флагманское сравнение с конкурсом на RBX1 сделано на мишени, отчет по итогам которого лежал у агента в папке для чтения — и так с четырьмя из шести конкурсных мишеней. На двух мишенях, специально взятых чистыми, чтобы исключить подсказки из обучающих данных, результат скромный: на 15-PGDH ничья с людьми, на latent GDF-8 победа, но прогон шел без контрольных образцов. Успех на TNF-альфа — двенадцать связывателей — на поверку держится на четырех каркасах, восемь из двенадцати вообще варианты одного и того же каркаса Genie 3.
Интересно и то, как результат менялся по дороге к публике. В техническом отчете черным по белому: сопоставимую кампанию с людьми-экспертами мы не проводили и не утверждаем, что дизайны Claude лучше, чем эксперт получил бы с теми же инструментами и бюджетом. В блог-посте Anthropic это звучит уже как "на уровне ведущих экспертов или даже лучше" — и дальше по агрегаторам формулировка пошла гулять без всяких оговорок. Из содержательных возражений громче всех прозвучал Мартин Шкрели, бывший фармацевтический предприниматель, осужденный за мошенничество с ценными бумагами и отстраненный от индустрии, но в химии разбирающийся. Он заявил, что аффинности низкие и что внутрь клетки такие молекулы все равно не попадают. Первое неверно фактически: он смотрел на девять значений с рекламной картинки, тогда как в отчете 90 связывателей крепче 10 наномолей и 42 крепче одного. Второе верно, но это претензия к классу молекул вообще — белки такого размера через мембрану не проходят никакие.
При всем этом работа сильна ровно тем, что делает возможной саму критику. Anthropic выложила промпты, все 1440 дизайнов, сырые показания приборов обеих лабораторий и результаты провалившихся кампаний тоже — так поступает меньшинство. Валидацию делали две коммерческие лаборатории вслепую друг от друга, и это физика в пробирке, а не самоотчет нейросети. Честная формулировка результата такая: агент впервые сам, без человека в контуре, отработал за вычислительного биолога полный цикл и на хорошо изученных мишенях выдал результат на уровне сильных команд. Цена вопроса — от 10 до 50 тысяч долларов вычислений на кампанию, но сама возможность пока закрыта: биология заблокирована в публичном Fable 5 из-за рисков двойного назначения, программу доступа для ученых только обещают. Инструменты у всех уже есть, промпт выложен — возможно, другая модель без подобных ограничений справится лучше.
P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.
Превратите ее в настоящий сайт, игру или другой проект, просто описав задумку словами. А готовую работу можно отправить на конкурс и побороться за один из 15 призов.
А игру про будильник? А тест «Какой вы хлеб»? Или полезный сервис, который давно держите в голове? Показываем, как превратить идею в настоящий сайт, игру или веб-приложение, просто описав задумку словами. А готовый проект можно отправить на конкурс и побороться за один из 15 призов.
Извиняюсь за мое личное субъективное мнение, косность мышления и отсутствие образования инженера-программиста, сугубо высер мимоидиота. Почему же приложения на андроид так много весят? А потому что, в случае андроида мы боремся за производительность приложения и его приспособленность под различные подвиды архитектуры ARM, различное разрешение экранов и прочее. То есть под каждую архитектуру делается отдельное приложение и качая с Rustore он вам пихает установочный apk-архив со всем этим, а масштабирование - легче нарисовать иконку под разные размеры экрана для разработчика и для вашего устройства. Так как мало сделать рабочее приложение, оно должно работать без серьезных зависаний и вылетов на любом андроид-устройстве.