На этой неделе авторы показывают, как дать агенту ограниченный доступ к действиям: через подтверждение SSH-команд, права в OpenCode и токены перед базой данных. Рядом идут методы проверки результата: локальный RAG с исходными строками, свой бенчмарк LLM и аудит файлов, которые читает Claude Code. Во всех примерах полезно начать с тестовой среды и сохранить наблюдаемый результат.
⚡
Главные статьи недели
01
Локальный RAG показывает, из каких строк взял ответ
Автор собрал учебное приложение для вопросов к локальным Markdown- и TXT-файлам. Оно строит индекс, ищет фрагменты и показывает исходный текст рядом с ответом; такой путь удобно разобрать по шагам перед своим RAG-проектом.
🔑 Главное
В репозитории local-docs-ai есть команды диагностики, индексации, поиска и ответа.
Для эмбеддингов используется embeddinggemma, для ответа — qwen3:1.7b через Ollama.
Предел примера — 50 файлов и 1 000 000 байт текста; PDF пропускается. Автор пока не показал живой прогон с моделями.
⚡ Попробовать за вечер
Клонировать balyakin/local-docs-ai, загрузить модели embeddinggemma и qwen3:1.7b в Ollama, выполнить python docqa.py doctor.
Положить свои Markdown- или TXT-файлы в папку примера, выполнить python docqa.py index, затем python docqa.py search и python docqa.py ask с одним вопросом.
Метрика: сверить ответ и показанные строки источника; записать долю вопросов, для которых найден верный фрагмент.
Граница примера: Это учебный индекс в памяти; точность на реальных документах не измерена.
OpenCode начинает работу с разрешений и одного скилла
✍ Арина БолоноваХабр⏱ ≈9 минБлог компании SelectelИскусственный интеллект
О чём
Статья показывает, как перейти от обычного чата к агенту OpenCode: настроить подтверждения, отключить публикацию сессии и добавить свой скилл проверки кода. Для первого запуска важнее именно эти управляемые шаги.
🔑 Главное
Минимальный opencode.json задаёт edit и bash со значением ask, а share — disabled.
Скилл лежит в .opencode/skills/code-review/SKILL.md; статья приводит YAML и последовательность ревью.
Расширенный пример конфига в начале статьи содержит синтаксические ошибки. Для копирования подходит короткий блок настройки разрешений.
⚡ Попробовать за вечер
Создать минимальный ~/.config/opencode/opencode.json с edit: ask, bash: ask и share: disabled по короткому примеру статьи.
Добавить .opencode/skills/code-review/SKILL.md по шаблону автора и запустить скилл на небольшом репозитории.
Метрика: проверить, что изменение файла и shell-команда требуют подтверждения, а скилл проходит все пункты ревью.
Граница примера: Конфиг провайдера придётся подстроить под свою среду; улучшение качества ревью статья не измеряет.
✍ Илья КучминХабр⏱ ≈10 минБлог компании HaulmontПрограммирование
О чём
На примере API ветеринарной клиники автор проводит изменение через Propose, Apply и Archive. Отдельные delta-спецификации описывают правку, а основная спецификация хранит актуальное состояние проекта.
🔑 Главное
После openspec init агент получает команды /opsx:propose, /opsx:apply и /opsx:archive.
Перед реализацией можно прочитать предложение, задачи и изменённые требования.
Архивация переносит изменения из delta в main и кладёт каталог правки в changes/archive/.
⚡ Попробовать за вечер
Установить OpenSpec CLI по ссылке автора и выполнить openspec init в небольшом проекте.
Попросить агента через /opsx:propose описать один новый эндпоинт, проверить спецификацию, затем выполнить /opsx:apply и /opsx:archive.
Метрика: сравнить требование в delta до реализации и в main после архивации; проверить созданный эндпоинт тестом.
из статьи
На картинке: Схема различает delta-спецификации отдельной правки и main-спецификации актуальной системы.
Граница примера: Нужен агент с командами OpenSpec; пример написан для Spring Boot.
Автор предлагает простой реестр скиллов для технической команды: Git хранит версии, Merge Request и CODEOWNERS дают процесс проверки, а CLI устанавливает нужный скилл. Подход полезен там, где команда уже ведёт код в GitLab.
🔑 Главное
Публикация проходит через Merge Request, проверки CI, ревью CODEOWNERS и merge в main.
Для установки одного скилла приведена команда npx skills add с Git-URL и --skill code-review.
Выбор одного скилла не гарантирует скачивание только его папки: CLI делает shallow clone.
⚡ Попробовать за вечер
Создать тестовый Git-репозиторий со скиллом code-review и назначить CODEOWNERS.
Установить его командой npx skills add <адрес-репозитория> --skill code-review, затем обновить после изменения в защищённой ветке.
Метрика: проверить, что установка работает на чистой машине, а изменение скилла без ревью не попадает в main.
Граница примера: GitLab не становится каталогом с поиском и отдельными правами на каждый скилл.
Автор показывает ssh-commander на отдельном тестовом сервере. Агент читает состояние VPS и предлагает действия, но запись файла, перезапуск контейнера и произвольная команда требуют отдельного подтверждения.
🔑 Главное
Приложение запускается через Docker Compose и открывается на localhost:8080.
Перед опасным действием интерфейс показывает полную shell-команду: её можно подтвердить или отклонить.
Автор предупреждает о prompt injection и открытом локальном хранении SSH-паролей и API-ключей.
⚡ Попробовать за вечер
Поднять ssh-commander v0.1.1 через compose.yaml из статьи и подключить тестовый VPS.
Попросить агента найти дубликат файла и предложить удаление; раскрыть команду и отклонить её.
Метрика: убедиться, что файл остался на сервере после отказа, а команда была видна до подтверждения.
из статьи
На картинке: Скриншот показывает предложенную команду удаления и отдельные кнопки подтверждения и отказа.
Граница примера: Это проба конкретного инструмента на тестовом VPS, а не гарантия безопасной работы агента.
Для смешанной телефонной речи автор сравнивает три языковых прохода распознавателя. Он сначала удаляет подозрительные сегменты, затем ранжирует варианты по уверенности и охвату записи.
🔑 Главное
Кандидаты: автоматическое определение языка, принудительный uz/kk и принудительный ru.
Оценка умножает weightedConfidence на относительный coverage и число сегментов.
Итоговый score служит для выбора среди проходов, а не порогом «распозналось или нет».
⚡ Попробовать за вечер
На нескольких собственных звонках запустить три языковых прохода по схеме автора.
Отфильтровать повторяющиеся и пустые сегменты, вычислить score для каждого варианта и сохранить победителя с транскриптом.
Метрика: вручную разметить один фрагмент каждого звонка и сравнить потерянные слова у победителя и у выбора по одной уверенности.
Граница примера: Формула — эвристика одного сценария; преобразование avg_logprob в 0–100 описано не полностью.
Демо ограничивает доступ агента к заказам через токены и RLS
✍ Дмитрий АндреевХабр⏱ ≈7 минИнформационная безопасностьИскусственный интеллект
О чём
Воспроизводимое демо issuerd показывает, как агент обращается к PostgreSQL с ограниченными токенами, DPoP и RLS. Сценарий включает попытку получить чужой заказ и отдельное подтверждение возврата через CIBA.
🔑 Главное
Пример agentic-mcp запускается через Docker Compose и проверяется скриптом verify.py.
RLS проверяет владельца заказа до передачи результата агенту.
По умолчанию «агент» работает в scripted-режиме на регулярках; автор прямо отделяет демо от продакшена.
⚡ Попробовать за вечер
Клонировать issuerd/issuerd, открыть examples/agentic-mcp и выполнить docker compose up -d.
Запустить docker compose run --rm setup python verify.py, затем повторить запрос чужого заказа в демо.
Метрика: проверить отказ доступа к чужой записи и явное подтверждение возврата; сохранить след токенов и RLS.
из статьи
На картинке: Демо показывает отдельную трассу токена и границу доступа к заказам.
Граница примера: В демо простые секреты и кеш повторов в памяти; живую LLM оно не проверяет по умолчанию.
Выбор LLM стоит проверять на своих задачах и цене ответа
✍ Алексей ПеньковХабр⏱ ≈7 минИскусственный интеллектМашинное обучение
О чём
Автор собрал бенчмарк для агентных задач через ToolBench. Набор включает 24 вопроса, рубрику качества, ловушки и цену прогона; метод помогает выбрать модель под собственный рабочий процесс.
🔑 Главное
Вопросы, стартовый промпт, рубрика и MCP-инструменты задаются конфигом ToolBench.
Автор советует брать 20–30 реальных задач, фиксировать ответы и одинаковые настройки прогона.
Таблица сравнения основана на одном прогоне каждой комбинации по частному набору; общий рейтинг моделей из неё не следует.
⚡ Попробовать за вечер
Взять репозиторий ToolBench по ссылке статьи и составить 20 собственных задач с проверяемым ответом.
Задать рубрику «верно, со ссылкой, честно», одинаковый промпт и доступные только на чтение инструменты, затем прогнать две модели.
Метрика: посчитать выполненные задачи, стоимость и время на одной рубрике; повторить спорные случаи.
из статьи
На картинке: Таблица показывает оценку 24 задач рядом с временем и стоимостью каждого прогона.
Граница примера: Команд установки и полного конфига в тексте нет; их надо взять из репозитория.
Логи Claude Code показывают, какие документы агент открывал
✍ Сергей БурыйХабр⏱ ≈5 минИскусственный интеллектПрограммирование
О чём
Автор проверил, какие Markdown-файлы своего проекта Claude Code читал во время задач. В статье есть Python-скрипт для локальных JSONL-логов и сравнение с файлами репозитория.
🔑 Главное
Журналы лежат в ~/.claude/projects/ и содержат вызовы инструментов.
Скрипт учитывает Read и часть команд Bash: cat, head, tail и sed.
На одном проекте документы со ссылками из точки входа открывались чаще, но автор называет это корреляцией.
⚡ Попробовать за вечер
В корне своего Git-проекта запустить Python-скрипт из статьи по локальным логам Claude Code.
Выбрать один нужный, но неоткрытый документ и добавить на него ссылку из CLAUDE.md или команды агента.
Метрика: через месяц повторить скрипт и сравнить число открытий файла; отдельно проверить пропущенные способы чтения.
из статьи
На картинке: График показывает, как часто агент открывал документы с разными типами ссылок.
Граница примера: Скрипт не видит все способы чтения, а наблюдение сделано на одном проекте.
Автор изолировал агенту доступ к копии базы 1С через собственную RDP-обвязку. Он показал создание HTTP-метода GET и проверил, что 1С вернула ожидаемый пустой ответ с кодом 200.
🔑 Главное
В репозитории qwen-1c-rdp есть agent-rdp, конфигурация LiteLLM и пример задания.
Обвязка передаёт агенту свежий снимок именно RDP-сессии, чтобы координаты клика не сбивались из-за рабочего стола.
Статья показывает метод-заглушку после четырёх ручных подсказок; генерация серийных номеров этим не доказана.
⚡ Попробовать за вечер
Подготовить изолированную копию базы 1С и бэкап по инструкции автора, поднять agent-rdp и шлюз LiteLLM из qwen-1c-rdp.
Попросить агента добавить тестовый GET-метод без бизнес-логики и проверить запросом к копии базы.
Метрика: получить HTTP 200 и пустой ответ от заглушки, затем проверить созданный обработчик руками.
из статьи
На картинке: Схема сравнивает промахи клика с прямым доступом агента к RDP-сессии.
Граница примера: Нужен стенд 1С и RDP; локальную модель через agent-rdp автор не проверил.
История собственного MCP-сервера полезна как список задач после первого прототипа: автор обсуждает авторизацию, тесты и публикацию. Пошаговый рецепт сборки вынесен в исходники.
Личный стек OpenCode, Oh My OpenCode и OpenSpec показывает, какие расширения люди совмещают. Совместимость и поведение плагинов придётся проверять на своей версии.
Оркестратор кодинг-агентов описывает граф шагов и контрольные точки человека. Пример полезен для планирования процесса, но эффект на задачах автор не измерил.