● TELEGRAM AI DIGEST · BACKEND / AGENTS

AI-дайджест недели

Практичные приёмы, релизы и сдвиги из AI/agent-каналов Telegram для Go-backend инженера: что попробовать или поменять в работе на этой неделе.

🗓 окно 27 июля — 3 августа 2026 ⚡ выводов: 8 👀 на радаре: 5 📡 сообщений прочитано: 27
💡 Что важно на этой неделе

Неделя вышла про гигиену агентского сетапа, а не про модели. Два независимых сюжета сошлись в одном: обвязка вокруг агента протухает быстрее кода, и её надо чистить — аудит скиллов и один routing-скилл вместо десятка пересекающихся, а внешние API отдавать агенту через CLI внутри скилла, иначе он выдумывает параметры запросов. Второй сюжет — деньги: Luna подешевела в пять раз, DeepSeek V4 Flash 0731 сел на Парето-фронтир по цене агентского таска и совместим с Codex, так что дефолтную модель в пайплайне пора пересчитать. Из тревожного: в GPT 5.6 Sol компакт молча съедает свежую инструкцию, а Codex научился писать в соседние чаты — обе штуки дешевле проверить руками, чем поймать на проде. Отдельной линией прошёл спор про loop engineering: скорость агента не отменяет требования понимать систему на уровень ниже, иначе прод ляжет следующим кварталом.

Главные практические выводы

01

Прогнать аудит скиллов и свести пересечения в один routing-скилл

источник: Остриков пилит агентов 2 авг

Автора забанили в Claude, он в спешке переехал на Codex — и два с половиной дня ушло не на код, а на разбор скиллов: дубли, устаревшее, знания, размазанные по заметкам памяти и CLAUDE.md. Для одной внутренней системы нашлось три скилла от трёх авторов с разными сильными сторонами.

Почему важно: набор скиллов растёт незаметно и рвётся при смене харнесса. Чем больше у скиллов пересечений, тем чаще агент берёт не тот — и это видно только по испорченному результату, а не по ошибке.

⚡ Как применить
  • Отдать агенту список всех скиллов, попавших в контекст, и попросить пометить дубли, устаревшее и то, что завязано на конкретный харнесс.
  • По похожим скиллам написать один routing-скилл: сценарий → какая часть какого скилла. AGENTS.md держать пустым от этих правил.
  • Просканировать заметки памяти и AGENTS.md на обрывки подсказок про скиллы и слить годное в тот же routing-скилл.
  • Проверка: взять три типовые задачи и посчитать, сколько раз агент выбрал нужный скилл с первого раза — до чистки и после.

Риск routing-скилл сам становится точкой отказа: если не обновлять его вместе со скиллами, он начнёт уводить агента не туда, и найти это будет сложнее, чем обычный дубль.

Источник: Остриков пилит агентов, 2 авг 2026, tdl-кеш aostrikov_ai_agents, id=173
02

Внешние API отдавать агенту через CLI внутри скилла, а не схемой запроса

источник: Остриков пилит агентов 28 июл

Разбор прод-агента AllenAI, который отвечает на вопросы про суда в морском пространстве Ганы. Больше пяти внешних API реального времени сначала пытались собирать запросами на лету — пошёл фон галлюцинаций. В итоге API завернули в CLI внутри скиллов: это закрыло проблему и упростило тестирование.

Почему важно: на Go-backend приём ложится один в один. CLI даёт агенту узкий детерминированный интерфейс вместо свободной сборки HTTP-запроса, а заодно превращает интеграцию в обычный бинарь, который можно покрыть тестами и эвалами.

БЫЛО Агент запрос на лету схема 5+ внешних API в промпте фон галлюцинаций СТАЛО Агент 3–5 команд скилл с CLI он же ходит в API эвалы в песочнице судья, критерии 0–1 с весами
сырая схема API → фантазии; CLI → проверяемый вызов
⚡ Как применить
  • Взять один внешний API, которым агент пользуется чаще всего, и написать под него маленький CLI на Go с 3–5 подкомандами. Описание API из промпта убрать.
  • Положить бинарь внутрь скилла и оставить агенту только команды и примеры вызова.
  • Собрать 5 эвал-кейсов на реальных данных: проверять, что агент вызвал нужную команду, и оценивать ответ судьёй по 2–3 критериям с весами, шкала 0–1.
  • Проверка: на тех же 5 кейсах сравнить долю прогонов с выдуманными параметрами запроса до CLI и после.

Риск CLI фиксирует сценарии: редкий нестандартный запрос агент теперь не соберёт вовсе. Нужен запасной путь либо подкоманда с сырыми параметрами.

Источник: Остриков пилит агентов, 28 июл 2026, tdl-кеш aostrikov_ai_agents, id=169
03

После компакта переспрашивать агента, какая у него последняя инструкция

источник: Глеб Кудрявцев про AI 28 июл

В GPT 5.6 Sol поменяли механизм компакта. Живой случай: задачу написали в тред, запустился компакт — и агент отчитался о ранее завершённых задачах, полностью проигнорировав новую. На 5.5 такого не было.

Почему важно: задача теряется молча. Агент не падает и не переспрашивает, а рапортует об успехе. В длинной сессии это всплывает, только когда идёшь смотреть результат.

⚡ Как применить
  • Держать текущую задачу в файле репозитория (docs/task.md), а в чат кидать ссылку на файл, не только текст: файл компакт не съест.
  • Сразу после компакта, до приёма любого отчёта, задавать один вопрос: какая последняя инструкция и что по ней сделано.
  • Новую задачу не отдавать, когда контекст почти полон: дождаться компакта и поставить её заново.
  • Проверка: в ближайших трёх длинных сессиях записать, сколько раз после компакта агент назвал задачу неверно.

Риск это одно наблюдение одного человека без разбора причин. Поведение может отличаться между харнессами и уже могло измениться в свежей сборке — прежде чем менять процесс, стоит воспроизвести у себя.

Источник: Глеб Кудрявцев про AI, 28 июл 2026, tdl-кеш gleb_pro_ai, id=694
04

Codex ходит в соседние чаты: собрать на этом оркестрацию и проверить границы

источник: AI и грабли 29 июл

Недокументированное изменение в Codex: агент сам ходит в соседние диалоги и пишет в них. Это не субагенты, а полноценные чаты. Фича идёт в связке с новым голосовым режимом: голосом управлять всеми своими текущими чатами. Автор пишет, что кейсов применения пока не придумал, и собирает их в комментариях.

Почему важно: два следствия сразу. Длинные задачи можно развести по чатам и дирижировать из одного, не перенося контекст руками. И обратное: агент теперь способен написать в рабочий тред, который трогать не собирались.

⚡ Как применить
  • Открыть два чата: в первом запустить долгую задачу (миграция, прогон тестов), во втором попросить агента забрать оттуда статус и свести короткий отчёт.
  • Проверить границу: попросить агента написать в чат, который трогать нельзя, и посмотреть, спросит ли он подтверждение.
  • Проверка: статус из первого чата пришёл во второй без копипаста — приём рабочий. Агент молча написал в запретный чат — оркестрацию отложить и держать рабочие треды в отдельном аккаунте или проекте.

Риск фича не документирована, поэтому может измениться или исчезнуть без предупреждения. Строить на ней процесс, от которого зависит релиз, рано.

Источник: AI и грабли, 29 июл 2026, tdl-кеш ai_i_grabli, id=535
05

Прогнать фоновый агентский сценарий на DeepSeek V4 Flash 0731

источник: LLM под капотом эйай ньюз 31 июл — 1 авг

DeepSeek заново прогнал пост-трейн V4 Flash под coding, reasoning и agent workflows. Модель MoE на 284B параметров, активных — 13B. На бенчмарке «LLM под капотом» версия 0731 попала на Парето-фронтир цена/качество в долгоиграющих агентских задачах, рядом с gpt-oss-120b, но прогон занял в 2,5 раза больше времени, чем у предыдущей версии. Работает через Responses API и совместима с Codex.

Почему важно: совместимость с Codex и Responses API означает, что подмена модели — вопрос конфига, а не переписывания интеграции. По деньгам на таск модель выходит в разы дешевле Luna, хотя Luna решает задачи быстрее и меньшим числом токенов.

⚡ Как применить
  • Взять один повторяющийся фоновый сценарий — генерацию тестов, разбор логов, черновой рефакторинг — и прогнать его на V4-Flash-0731 через Responses API.
  • Мерить не цену за миллион токенов, а стоимость и время доведённого до конца таска: токенов столько же, но времени уходит больше.
  • Проверка: если цена таска ниже, а доля прогонов, дошедших до результата, та же — переводить фон на неё, интерактив оставить быстрой модели.

Риск веса ещё не выложили, модель есть только в API, в чате DeepSeek до сих пор старая версия. gpt-oss-120b держит фронтир по скорости, а обновление до V4 Pro обещают в первых числах августа — возможно, мерить придётся заново.

Источник: LLM под капотом, 1 авг 2026, tdl-кеш llm_under_hood, id=916 · эйай ньюз, 31 июл 2026, tdl-кеш ai_newz, id=4670
06

Цены GPT 5.6 упали в пять раз — пересчитать дефолтную модель пайплайна

источник: эйай ньюз 30 июл

Luna подешевела впятеро: $0.2/$1.2 за миллион токенов против $1/$6 на релизе. Terra сбросили на 20%, до $2/$12. Sol цену сохранил, но получил Fast-режим — в 2,5 раза быстрее за двойную цену. Снижение затронуло не только API, но и квоты в Codex и ChatGPT Work.

Почему важно: расклад «дорогая модель только на сложное» пересобирается. Шаги пайплайна, которые сидели на слабой модели ради цены, теперь могут окупить переезд на Luna, а Fast-режим меняет расчёт там, где ответа ждёт человек, а не очередь.

⚡ Как применить
  • Выписать шаги пайплайна, где модель выбрана по цене, и пересчитать месячную стоимость по новым $0.2/$1.2.
  • На одном шаге, где не хватало качества, поднять модель до Luna и прогнать тот же набор кейсов.
  • Fast-режим Sol включить только там, где ответа ждут вживую, и посмотреть, окупает ли двойная цена сэкономленные минуты.
  • Проверка: месячный счёт и p95 времени ответа до и после. Счёт вырос, а время не упало — откатить.

Риск цифры взяты из пересказа канала, без ссылки на прайс-лист — перед миграцией сверить с официальным. Про дату запуска Sol на железе Cerebras OpenAI по-прежнему молчит, так что планировать на это нечего.

Источник: эйай ньюз, 30 июл 2026, tdl-кеш ai_newz, id=4669
07

OCR целиком в браузере — когда документы нельзя отдавать наружу

источник: Глеб Кудрявцев про AI 28 июл — 1 авг

Автор за неделю с Kimi K3 написал с нуля инференс PaddleOCR-VL в браузере и выложил бесплатную версию: модель подгружается в браузер, распознавание идёт локально, ставить на компьютер ничего не нужно. Первая попытка отставала от нативного инференса в 10 раз, сейчас разрыв сократился до двукратного. Порог входа — порядка 4 ГБ видеопамяти, проверено на макбуках.

Почему важно: если документы нельзя отправлять во внешний API, локальный OCR закрывает задачу без развёртывания сервиса. Рядом лежит второй урок: у автора качество распознавания просело не из-за модели, а из-за 180 DPI вместо 300 на входе — шли замены символов, посторонние слова и зацикливание.

⚡ Как применить
  • Прогнать десяток своих сканов через sotaocr.com/ru/free-ocr и сравнить с текущим OCR по числу ошибок в ключевых полях.
  • В своём пайплайне нормализовать вход до 300 DPI перед подачей в OCR или VLM и прогнать те же документы на 180 и 300 DPI.
  • Проверка: доля документов, где ключевые поля распознались без ручной правки, на двух разрешениях.

Риск Windows не проверен, автор ищет тестера с видеокартой. В браузере вдвое медленнее натива, и всё упирается в железо клиента — для массового потока документов это не замена серверному OCR.

Источник: Глеб Кудрявцев про AI, 28 июл — 1 авг 2026, tdl-кеш gleb_pro_ai, id=695, 699, 702, 704
08

Не мержить агентский PR, пока не можешь описать, что происходит уровнем ниже

источник: AI и грабли 28 июл

Разбор тезиса «после Fable и 5.6 Sol вы больше не software engineer, вы loop engineer». Контраргумент из первых принципов: хороший инженер всегда понимал систему на уровень абстракции ниже того, на котором писал — Python-разработчик про GIL, PyMalloc и сборщик мусора, C++ про уровни кэша, виртуальные таблицы и SIMD. Если инженер этого не знает, он не знает и о существовании проблем на этих уровнях.

Почему важно: диффы от агента приходят быстрее, чем успеваешь построить модель того, что под ними. Цена ошибки не в ревью, а через квартал: прод ложится под растущей нагрузкой, баги ищутся неделями и затыкаются костылями.

⚡ Как применить
  • На ближайшем агентском PR выписать три строки: что происходит с аллокациями, что с блокировками и горутинами, сколько запросов в БД уходит на один пользовательский запрос.
  • Нет ответа хотя бы на одну строку — не мержить, а попросить агента показать конкретное место и объяснить.
  • Внести требование в AGENTS.md: к диффу приложить, что меняется уровнем ниже — запросы, локи, аллокации.
  • Проверка: за неделю посчитать, сколько агентских PR прошли этот вопрос с первого раза.

Риск на мелких правках ритуал только тормозит. Включать его на изменения в горячем пути, в работе с состоянием и в слое доступа к данным.

Источник: AI и грабли, 28 июл 2026, tdl-кеш ai_i_grabli, id=534
🛰

На радаре, но без действий

Держу в голове, внедрять пока нечего: либо нет проверяемого приёма, либо не доехало до повседневной работы.

🛰 Разбор статьи Anthropic про работу с моделями Claude 5

AI RANEZ30 июл

Автор разобрал статью инженера Anthropic про изменения в работе с пятым поколением и прогнал выводы через скилл для Claude Code. Ссылок на статью и сам скилл в посте нет, поэтому проверяемого шага пока не собрать.

Пост ↗

🛰 Приём ответа на вопросы в Codex App и надиктовка заметок

Автор рекомендует свой способ отвечать на вопросы агента в Codex App и диктовать заметки голосом. В комментариях спорят, что в CLI проще: большой текст читать тяжело, поэтому сразу апрув. Сам приём в тексте не описан.

Пост ↗

🛰 Веса Kimi K3: 2.8T параметров и 2 ТБ памяти на запуск

Moonshot выложили веса крупнейшей открытой модели: 2.8T параметров, 104B активных. Для локального запуска нужна система с 2 ТБ памяти, так что до рабочей машины это не доедет. Держу как ориентир по открытым весам.

Пост ↗

🛰 Доклад про поверхности атаки на агентные системы

Среди записей конференции в Омске есть доклад про поверхности атаки на агентные системы и защиту от них, а также про кастомный сетап для AI-разработки. Записи платные либо бесплатно через бота автора; содержания в посте нет.

Пост ↗

🛰 Astra доказала 10 открытых матзадач и формализовала их в Lean

Мультиагентная модель OpenAI доказала десять задач, часть из которых оставалась открытой десятилетиями, потратив на все токены меньше $2000 по расценкам Sol. Для backend-работы следствий нет, но цифра стоимости показывает, во что упирается потолок мультиагентных прогонов.

Пост ↗
🧹

Что отфильтровано

Из 27 сообщений в окне: 12 легли в карточки, 5 ушли на радар, 10 выброшены.

Шутки и шитпост без вывода 6 Реклама, курсы, хакатоны 3 Нерелевантное backend (видеогенерация) 1 Повторы 0 Research без действия 0
🎯

План на неделю

Из восьми выводов выше — три, которые реально внедрю. Не «прочитать», а сделать.

Почистить скиллы: прогнать аудит агентом, удалить дубли и устаревшее, свести пересечения в один routing-скилл, AGENTS.md оставить без этих правил
до пятницы
Обернуть API в CLI: взять самый частый внешний API, написать под него CLI на Go с 3–5 подкомандами, положить в скилл и прогнать 5 эвал-кейсов с судьёй
до воскресенья
Проверить компакт: в трёх длинных сессиях после каждого компакта спрашивать агента про последнюю инструкцию и записывать промахи
в течение недели
#

Метаданные

сгенерировано 2026-08-03T05:47:59Z
окно 2026-07-27 — 2026-08-03 (7 дней), фолбэк окна не понадобился
прочитано / в дайджест 27 сообщений из 6 каналов / 8 выводов и 5 пунктов на радаре
источник локальный кеш tdl-экспортов; перед сборкой прогнан tdl chat export (read-only) по всем 9 каналам
каналы без данных в окне llm_x_news_in_actions, «{ между скобок } анонсы», Tuzov AI Lab
качество ссылок 27 из 27 точные (t.me/username/id), best-effort нет
×
Открыть пост