Практичные приёмы, релизы и сдвиги из AI/agent-каналов Telegram для Go-backend инженера: что попробовать или поменять в работе на этой неделе.
🗓 окно 27 июля — 3 августа 2026⚡ выводов: 8👀 на радаре: 5📡 сообщений прочитано: 27
💡 Что важно на этой неделе
Неделя вышла про гигиену агентского сетапа, а не про модели. Два независимых сюжета сошлись в одном: обвязка вокруг агента протухает быстрее кода, и её надо чистить — аудит скиллов и один routing-скилл вместо десятка пересекающихся, а внешние API отдавать агенту через CLI внутри скилла, иначе он выдумывает параметры запросов. Второй сюжет — деньги: Luna подешевела в пять раз, DeepSeek V4 Flash 0731 сел на Парето-фронтир по цене агентского таска и совместим с Codex, так что дефолтную модель в пайплайне пора пересчитать. Из тревожного: в GPT 5.6 Sol компакт молча съедает свежую инструкцию, а Codex научился писать в соседние чаты — обе штуки дешевле проверить руками, чем поймать на проде. Отдельной линией прошёл спор про loop engineering: скорость агента не отменяет требования понимать систему на уровень ниже, иначе прод ляжет следующим кварталом.
⚡
Главные практические выводы
01
Прогнать аудит скиллов и свести пересечения в один routing-скилл
Автора забанили в Claude, он в спешке переехал на Codex — и два с половиной дня ушло не на код, а на разбор скиллов: дубли, устаревшее, знания, размазанные по заметкам памяти и CLAUDE.md. Для одной внутренней системы нашлось три скилла от трёх авторов с разными сильными сторонами.
Почему важно: набор скиллов растёт незаметно и рвётся при смене харнесса. Чем больше у скиллов пересечений, тем чаще агент берёт не тот — и это видно только по испорченному результату, а не по ошибке.
⚡ Как применить
Отдать агенту список всех скиллов, попавших в контекст, и попросить пометить дубли, устаревшее и то, что завязано на конкретный харнесс.
По похожим скиллам написать один routing-скилл: сценарий → какая часть какого скилла. AGENTS.md держать пустым от этих правил.
Просканировать заметки памяти и AGENTS.md на обрывки подсказок про скиллы и слить годное в тот же routing-скилл.
Проверка: взять три типовые задачи и посчитать, сколько раз агент выбрал нужный скилл с первого раза — до чистки и после.
Риск routing-скилл сам становится точкой отказа: если не обновлять его вместе со скиллами, он начнёт уводить агента не туда, и найти это будет сложнее, чем обычный дубль.
Разбор прод-агента AllenAI, который отвечает на вопросы про суда в морском пространстве Ганы. Больше пяти внешних API реального времени сначала пытались собирать запросами на лету — пошёл фон галлюцинаций. В итоге API завернули в CLI внутри скиллов: это закрыло проблему и упростило тестирование.
Почему важно: на Go-backend приём ложится один в один. CLI даёт агенту узкий детерминированный интерфейс вместо свободной сборки HTTP-запроса, а заодно превращает интеграцию в обычный бинарь, который можно покрыть тестами и эвалами.
сырая схема API → фантазии; CLI → проверяемый вызов
⚡ Как применить
Взять один внешний API, которым агент пользуется чаще всего, и написать под него маленький CLI на Go с 3–5 подкомандами. Описание API из промпта убрать.
Положить бинарь внутрь скилла и оставить агенту только команды и примеры вызова.
Собрать 5 эвал-кейсов на реальных данных: проверять, что агент вызвал нужную команду, и оценивать ответ судьёй по 2–3 критериям с весами, шкала 0–1.
Проверка: на тех же 5 кейсах сравнить долю прогонов с выдуманными параметрами запроса до CLI и после.
Риск CLI фиксирует сценарии: редкий нестандартный запрос агент теперь не соберёт вовсе. Нужен запасной путь либо подкоманда с сырыми параметрами.
В GPT 5.6 Sol поменяли механизм компакта. Живой случай: задачу написали в тред, запустился компакт — и агент отчитался о ранее завершённых задачах, полностью проигнорировав новую. На 5.5 такого не было.
Почему важно: задача теряется молча. Агент не падает и не переспрашивает, а рапортует об успехе. В длинной сессии это всплывает, только когда идёшь смотреть результат.
⚡ Как применить
Держать текущую задачу в файле репозитория (docs/task.md), а в чат кидать ссылку на файл, не только текст: файл компакт не съест.
Сразу после компакта, до приёма любого отчёта, задавать один вопрос: какая последняя инструкция и что по ней сделано.
Новую задачу не отдавать, когда контекст почти полон: дождаться компакта и поставить её заново.
Проверка: в ближайших трёх длинных сессиях записать, сколько раз после компакта агент назвал задачу неверно.
Риск это одно наблюдение одного человека без разбора причин. Поведение может отличаться между харнессами и уже могло измениться в свежей сборке — прежде чем менять процесс, стоит воспроизвести у себя.
Недокументированное изменение в Codex: агент сам ходит в соседние диалоги и пишет в них. Это не субагенты, а полноценные чаты. Фича идёт в связке с новым голосовым режимом: голосом управлять всеми своими текущими чатами. Автор пишет, что кейсов применения пока не придумал, и собирает их в комментариях.
Почему важно: два следствия сразу. Длинные задачи можно развести по чатам и дирижировать из одного, не перенося контекст руками. И обратное: агент теперь способен написать в рабочий тред, который трогать не собирались.
⚡ Как применить
Открыть два чата: в первом запустить долгую задачу (миграция, прогон тестов), во втором попросить агента забрать оттуда статус и свести короткий отчёт.
Проверить границу: попросить агента написать в чат, который трогать нельзя, и посмотреть, спросит ли он подтверждение.
Проверка: статус из первого чата пришёл во второй без копипаста — приём рабочий. Агент молча написал в запретный чат — оркестрацию отложить и держать рабочие треды в отдельном аккаунте или проекте.
Риск фича не документирована, поэтому может измениться или исчезнуть без предупреждения. Строить на ней процесс, от которого зависит релиз, рано.
DeepSeek заново прогнал пост-трейн V4 Flash под coding, reasoning и agent workflows. Модель MoE на 284B параметров, активных — 13B. На бенчмарке «LLM под капотом» версия 0731 попала на Парето-фронтир цена/качество в долгоиграющих агентских задачах, рядом с gpt-oss-120b, но прогон занял в 2,5 раза больше времени, чем у предыдущей версии. Работает через Responses API и совместима с Codex.
Почему важно: совместимость с Codex и Responses API означает, что подмена модели — вопрос конфига, а не переписывания интеграции. По деньгам на таск модель выходит в разы дешевле Luna, хотя Luna решает задачи быстрее и меньшим числом токенов.
⚡ Как применить
Взять один повторяющийся фоновый сценарий — генерацию тестов, разбор логов, черновой рефакторинг — и прогнать его на V4-Flash-0731 через Responses API.
Мерить не цену за миллион токенов, а стоимость и время доведённого до конца таска: токенов столько же, но времени уходит больше.
Проверка: если цена таска ниже, а доля прогонов, дошедших до результата, та же — переводить фон на неё, интерактив оставить быстрой модели.
Риск веса ещё не выложили, модель есть только в API, в чате DeepSeek до сих пор старая версия. gpt-oss-120b держит фронтир по скорости, а обновление до V4 Pro обещают в первых числах августа — возможно, мерить придётся заново.
Luna подешевела впятеро: $0.2/$1.2 за миллион токенов против $1/$6 на релизе. Terra сбросили на 20%, до $2/$12. Sol цену сохранил, но получил Fast-режим — в 2,5 раза быстрее за двойную цену. Снижение затронуло не только API, но и квоты в Codex и ChatGPT Work.
Почему важно: расклад «дорогая модель только на сложное» пересобирается. Шаги пайплайна, которые сидели на слабой модели ради цены, теперь могут окупить переезд на Luna, а Fast-режим меняет расчёт там, где ответа ждёт человек, а не очередь.
⚡ Как применить
Выписать шаги пайплайна, где модель выбрана по цене, и пересчитать месячную стоимость по новым $0.2/$1.2.
На одном шаге, где не хватало качества, поднять модель до Luna и прогнать тот же набор кейсов.
Fast-режим Sol включить только там, где ответа ждут вживую, и посмотреть, окупает ли двойная цена сэкономленные минуты.
Проверка: месячный счёт и p95 времени ответа до и после. Счёт вырос, а время не упало — откатить.
Риск цифры взяты из пересказа канала, без ссылки на прайс-лист — перед миграцией сверить с официальным. Про дату запуска Sol на железе Cerebras OpenAI по-прежнему молчит, так что планировать на это нечего.
Автор за неделю с Kimi K3 написал с нуля инференс PaddleOCR-VL в браузере и выложил бесплатную версию: модель подгружается в браузер, распознавание идёт локально, ставить на компьютер ничего не нужно. Первая попытка отставала от нативного инференса в 10 раз, сейчас разрыв сократился до двукратного. Порог входа — порядка 4 ГБ видеопамяти, проверено на макбуках.
Почему важно: если документы нельзя отправлять во внешний API, локальный OCR закрывает задачу без развёртывания сервиса. Рядом лежит второй урок: у автора качество распознавания просело не из-за модели, а из-за 180 DPI вместо 300 на входе — шли замены символов, посторонние слова и зацикливание.
⚡ Как применить
Прогнать десяток своих сканов через sotaocr.com/ru/free-ocr и сравнить с текущим OCR по числу ошибок в ключевых полях.
В своём пайплайне нормализовать вход до 300 DPI перед подачей в OCR или VLM и прогнать те же документы на 180 и 300 DPI.
Проверка: доля документов, где ключевые поля распознались без ручной правки, на двух разрешениях.
Риск Windows не проверен, автор ищет тестера с видеокартой. В браузере вдвое медленнее натива, и всё упирается в железо клиента — для массового потока документов это не замена серверному OCR.
Разбор тезиса «после Fable и 5.6 Sol вы больше не software engineer, вы loop engineer». Контраргумент из первых принципов: хороший инженер всегда понимал систему на уровень абстракции ниже того, на котором писал — Python-разработчик про GIL, PyMalloc и сборщик мусора, C++ про уровни кэша, виртуальные таблицы и SIMD. Если инженер этого не знает, он не знает и о существовании проблем на этих уровнях.
Почему важно: диффы от агента приходят быстрее, чем успеваешь построить модель того, что под ними. Цена ошибки не в ревью, а через квартал: прод ложится под растущей нагрузкой, баги ищутся неделями и затыкаются костылями.
⚡ Как применить
На ближайшем агентском PR выписать три строки: что происходит с аллокациями, что с блокировками и горутинами, сколько запросов в БД уходит на один пользовательский запрос.
Нет ответа хотя бы на одну строку — не мержить, а попросить агента показать конкретное место и объяснить.
Внести требование в AGENTS.md: к диффу приложить, что меняется уровнем ниже — запросы, локи, аллокации.
Проверка: за неделю посчитать, сколько агентских PR прошли этот вопрос с первого раза.
Риск на мелких правках ритуал только тормозит. Включать его на изменения в горячем пути, в работе с состоянием и в слое доступа к данным.
Автор разобрал статью инженера Anthropic про изменения в работе с пятым поколением и прогнал выводы через скилл для Claude Code. Ссылок на статью и сам скилл в посте нет, поэтому проверяемого шага пока не собрать.
Автор рекомендует свой способ отвечать на вопросы агента в Codex App и диктовать заметки голосом. В комментариях спорят, что в CLI проще: большой текст читать тяжело, поэтому сразу апрув. Сам приём в тексте не описан.
Moonshot выложили веса крупнейшей открытой модели: 2.8T параметров, 104B активных. Для локального запуска нужна система с 2 ТБ памяти, так что до рабочей машины это не доедет. Держу как ориентир по открытым весам.
Среди записей конференции в Омске есть доклад про поверхности атаки на агентные системы и защиту от них, а также про кастомный сетап для AI-разработки. Записи платные либо бесплатно через бота автора; содержания в посте нет.
Мультиагентная модель OpenAI доказала десять задач, часть из которых оставалась открытой десятилетиями, потратив на все токены меньше $2000 по расценкам Sol. Для backend-работы следствий нет, но цифра стоимости показывает, во что упирается потолок мультиагентных прогонов.