Одна ошибка агента — один короткий скилл, а не ещё сто строк в
Whetstone собрал 24 отдельных
Среди самых практичных:
—
—
—
—
—
Установка в Claude Code:
https://whetstone.akbarsha.dev/
CLAUDE.md.Whetstone собрал 24 отдельных
SKILL.md, появившихся после конкретных инженерных сбоев. Каждый файл содержит условия активации, одно основное правило, обезличенный пример и финальный чек-лист перед словом «готово».Среди самых практичных:
—
prove-the-test-can-fail — намеренно сломать код и убедиться, что тест действительно краснеет; —
audit-before-you-build — сначала найти уже существующую реализацию, потом писать новую; —
grep-the-blast-radius — искать всех потребителей изменённого контракта по старому имени; —
a-memory-is-not-a-trigger — обязательное действие запускать хуком, а не надеяться на память агента; —
safe-data-export — добавить и проверить .gitignore до появления чувствительных данных на диске.Установка в Claude Code:
/plugin marketplace add iamakbarsha1/whetstone /plugin install whetstone@whetstone-skillshttps://whetstone.akbarsha.dev/
Gauntlet прогоняет PR через коллегию из 23 независимых AI-судей — каждый отвечает только за свой класс рисков.
Команда /gauntlet:review принимает текущие изменения, номер PR, отдельный план или RFC, а также весь репозиторий.
Среди направлений — безопасность, архитектура, тесты, зависимости, инфраструктура, доступность, фронтенд, UX и качество файлов инструкций.
https://github.com/jacquardlabs/gauntlet
Команда /gauntlet:review принимает текущие изменения, номер PR, отдельный план или RFC, а также весь репозиторий.
Среди направлений — безопасность, архитектура, тесты, зависимости, инфраструктура, доступность, фронтенд, UX и качество файлов инструкций.
https://github.com/jacquardlabs/gauntlet
👀1
bb — это IDE, которую агенты могут достраивать прямо во время работы.
Попросили добавить трекер задач — агент пишет плагин и встраивает панель в интерфейс. По такой же схеме внутри bb работают автоматизации, память, GitHub-интеграция, удалённый доступ и фоновые задания.
В одном интерфейсе можно запускать Claude Code, Codex, Cursor, Pi, OpenCode, Grok, omp и Hermes Agent. Каждый работает через уже оплаченную подписку провайдера, а один агент может создавать и контролировать другие потоки.
Работу необязательно начинать руками: новый поток запускается через CLI из скрипта, cron-задачи или бота в Telegram, Signal и Slack. Получается локальный диспетчер для целой команды кодинг-агентов.
Установка —
https://getbb.app/
Попросили добавить трекер задач — агент пишет плагин и встраивает панель в интерфейс. По такой же схеме внутри bb работают автоматизации, память, GitHub-интеграция, удалённый доступ и фоновые задания.
В одном интерфейсе можно запускать Claude Code, Codex, Cursor, Pi, OpenCode, Grok, omp и Hermes Agent. Каждый работает через уже оплаченную подписку провайдера, а один агент может создавать и контролировать другие потоки.
Работу необязательно начинать руками: новый поток запускается через CLI из скрипта, cron-задачи или бота в Telegram, Signal и Slack. Получается локальный диспетчер для целой команды кодинг-агентов.
Установка —
npx bb-app@latest; macOS поддерживается нативно, Linux AppImage пока в alpha, Windows — через WSL2.https://getbb.app/
❤1😱1
Обнаружился баг в Hermes, из-за которого ризонинг не пробрасывается провайдеру.
Выяснилось, что🤯
Что делать: скопируйте новый конфиг из бота либо поменяйте в
Во Врата можно ходить и с openai, и с anthropic протоколом любыми моделями (мы всё равно всё конвертируем у себя как надо), поэтому GPT тоже корректно будет работать с этой настройкой.
Пример нового конфига:
Выяснилось, что
api_mode: chat_completions, который предлагался в готовом конфиге в @vrata_ai_bot, в Hermes вообще не работает с ризонингом на кастомных провайдерах Что делать: скопируйте новый конфиг из бота либо поменяйте в
~/.hermes/config.yaml строчку api_mode: chat_completions на api_mode: anthropic_messages. Во Врата можно ходить и с openai, и с anthropic протоколом любыми моделями (мы всё равно всё конвертируем у себя как надо), поэтому GPT тоже корректно будет работать с этой настройкой.
Пример нового конфига:
custom_providers:
- name: vrata.tg
base_url: "https://api.vrata.tg/v1"
api_mode: anthropic_messages
api_key: "sk-***"
models:
"claude-fable-5":
context_length: 1000000
supports_vision: true
"claude-opus-4-8":
context_length: 1000000
supports_vision: true
"claude-opus-5":
context_length: 1000000
supports_vision: true
"claude-sonnet-5":
context_length: 1000000
supports_vision: true
"gpt-5.6-luna":
context_length: 1050000
supports_vision: true
"gpt-5.6-sol":
context_length: 1050000
supports_vision: true
"gpt-5.6-terra":
context_length: 1050000
supports_vision: true
model:
provider: custom:vrata.tg
default: "gpt-5.6-sol"
Please open Telegram to view this post
VIEW IN TELEGRAM
GitHub
reasoning_effort / thinking_budget silently dropped for custom and zai providers · Issue #55276 · NousResearch/hermes-agent
Problem Hermes Agent's reasoning_effort / reasoning_config settings are silently dropped for several provider types: custom, zai (GLM), and any chat_completions-based provider whose ProviderPro...
Помните, в начале года вышел ARC-AGI-3 — интерактивный бенчмарк, где ИИ попадает в незнакомые игры без инструкций, правил и даже сформулированной цели?
Агент должен экспериментировать, сам понять устройство мира и научиться побеждать. На старте люди набирали 100%, а лучшие ИИ-системы — всего 0,51%.
Оказалось, что для прохождения бенчмарка на 100% достаточно всего лишь скилла на 129 строк. Claude Code прошёл все 25 публичных игр ARC-AGI-3 с одним жёстким правилом: сначала предскажи результат действия — потом нажимай.
Перед каждым действием агент обязан передать гипотезу через
После хода харнесс сравнивает гипотезу с новым состоянием поля, а последовательный план останавливает при первом расхождении — ошибочная модель не успевает сжечь остальные действия.
Получается короткий агентный цикл, который можно переносить далеко за пределы ARC: гипотеза → действие → автоматическая проверка → обновление знаний.
https://github.com/pbshgthm/arc-skill
Агент должен экспериментировать, сам понять устройство мира и научиться побеждать. На старте люди набирали 100%, а лучшие ИИ-системы — всего 0,51%.
Оказалось, что для прохождения бенчмарка на 100% достаточно всего лишь скилла на 129 строк. Claude Code прошёл все 25 публичных игр ARC-AGI-3 с одним жёстким правилом: сначала предскажи результат действия — потом нажимай.
Перед каждым действием агент обязан передать гипотезу через
--predict: какие клетки изменятся, куда сдвинется объект, завершится ли уровень или не произойдёт ничего.После хода харнесс сравнивает гипотезу с новым состоянием поля, а последовательный план останавливает при первом расхождении — ошибочная модель не успевает сжечь остальные действия.
Получается короткий агентный цикл, который можно переносить далеко за пределы ARC: гипотеза → действие → автоматическая проверка → обновление знаний.
https://github.com/pbshgthm/arc-skill
Управление Mac для ИИ-агента свели к шести примитивам и обычному Python.
Browser Use представила macOS Harness — тонкую прослойку между агентом и системой. Основной интерфейс:
Через него агент видит окна, отправляет клавиши и клики конкретному процессу, обращается к Apple Accessibility и Apple Events. Browser Harness добавляет доступ к реальному залогиненному Chrome через CDP, а
Если готового действия нет, агент дописывает недостающую логику прямо по ходу задачи. Никаких отдельных инструментов для Spotify, Slack или Final Cut — возможности растут из обычного кода, а не из бесконечного реестра интеграций.
Самая интересная деталь: Harness умеет снимать окно уже запущенного приложения и отправлять туда ввод, не выводя его на передний план и не двигая физический курсор. Если приложение всё-таки перехватывает фокус, операция останавливается с
https://github.com/browser-use/macos-harness
Browser Use представила macOS Harness — тонкую прослойку между агентом и системой. Основной интерфейс:
see, key, type, click, ax и script.Через него агент видит окна, отправляет клавиши и клики конкретному процессу, обращается к Apple Accessibility и Apple Events. Browser Harness добавляет доступ к реальному залогиненному Chrome через CDP, а
Path и subprocess оставляют под рукой файлы и shell.Если готового действия нет, агент дописывает недостающую логику прямо по ходу задачи. Никаких отдельных инструментов для Spotify, Slack или Final Cut — возможности растут из обычного кода, а не из бесконечного реестра интеграций.
Самая интересная деталь: Harness умеет снимать окно уже запущенного приложения и отправлять туда ввод, не выводя его на передний план и не двигая физический курсор. Если приложение всё-таки перехватывает фокус, операция останавливается с
FocusChangedError.https://github.com/browser-use/macos-harness
«Пиши короче и человечнее» — хорошее правило для ответа пользователю и плохое правило для работы ИИ-агента.
Кубер Мехта обратил внимание на популярность навыков вроде
Проблема в том, что эти правила действуют не только на финальный ответ. Модель сжимает информацию во время исследования, отладки и передачи задачи другому агенту. Каждое такое сжатие — потенциальная потеря данных.
Вместо:
следующий агент может получить:
«Большинство тестов прошло, но есть одна проблема».
Звучит приятнее. Отлаживать по этому уже нечего.
Предложение автора: внутри агентной системы сохранять схемы, диффы, точные ошибки, уровень уверенности и происхождение фактов. Человечный, короткий и доступный текст генерировать один раз — на границе, где результат читает пользователь.
База данных не хранит информацию в формате дашборда, а компилятор не делает промежуточное представление приятным для чтения. Для агентов логика та же: точное состояние внутри, удобный интерфейс снаружи.
Персонализация здесь ни при чём. Формат «объясни коротко и без перегруза» нужен — просто не как внутренний протокол мышления и общения между агентами.
https://kuber.studio/blog/Reflections/Humanising-LLM-Outputs-is-Actually-Dumb
Кубер Мехта обратил внимание на популярность навыков вроде
caveman, i-have-adhd и инструкций в AGENTS.md, заставляющих модели постоянно упрощать язык, убирать детали и оставлять только главное.Проблема в том, что эти правила действуют не только на финальный ответ. Модель сжимает информацию во время исследования, отладки и передачи задачи другому агенту. Каждое такое сжатие — потенциальная потеря данных.
Вместо:
5/6 PASS · FAIL: test_cache_invalidation · CAUSE: stale key survives restart · REPRO: tests/cache_test.py:184следующий агент может получить:
«Большинство тестов прошло, но есть одна проблема».
Звучит приятнее. Отлаживать по этому уже нечего.
Предложение автора: внутри агентной системы сохранять схемы, диффы, точные ошибки, уровень уверенности и происхождение фактов. Человечный, короткий и доступный текст генерировать один раз — на границе, где результат читает пользователь.
База данных не хранит информацию в формате дашборда, а компилятор не делает промежуточное представление приятным для чтения. Для агентов логика та же: точное состояние внутри, удобный интерфейс снаружи.
Персонализация здесь ни при чём. Формат «объясни коротко и без перегруза» нужен — просто не как внутренний протокол мышления и общения между агентами.
https://kuber.studio/blog/Reflections/Humanising-LLM-Outputs-is-Actually-Dumb
Одна команда в Claude превращает сложную тему в HTML-страничку без стены текста.
Anthropic выпустил плагин
На выходе — крупные иллюстрации и минимум слов для человека, который вообще не знаком с темой. Удобный формат для онбординга, документации и быстрых объяснений без отдельной презентации.
https://github.com/anthropics/claude-plugins-community/tree/main/eli5
Anthropic выпустил плагин
eli5. Он вызывается через /eli5 <topic>, например /eli5 как работает DNS.На выходе — крупные иллюстрации и минимум слов для человека, который вообще не знаком с темой. Удобный формат для онбординга, документации и быстрых объяснений без отдельной презентации.
https://github.com/anthropics/claude-plugins-community/tree/main/eli5
Одна и та же модель может стоить в пять раз дороже — только из-за выбранной агентной оболочки.
В эксперименте Love. Death. Transformers модели GPT-5.6 Sol и Kimi K3 запускали через Pi, Cline, Hermes Agent, Claude Code, Codex и Ouroboros. Задачи одинаковые: GPU-симуляция трёх тел и решение двумерного уравнения теплопроводности.
На четырёх комбинациях «модель × задача» Pi израсходовал суммарно $2.38, Claude Code — $8.50. В отдельных запусках разрыв составил от 3,1 до 5 раз.
Расход виден наглядно: цену агентной сессии определяет не только модель — выбранная оболочка может изменить итоговый счёт в несколько раз.
https://t.me/lovedeathtransformers/10975
В эксперименте Love. Death. Transformers модели GPT-5.6 Sol и Kimi K3 запускали через Pi, Cline, Hermes Agent, Claude Code, Codex и Ouroboros. Задачи одинаковые: GPU-симуляция трёх тел и решение двумерного уравнения теплопроводности.
На четырёх комбинациях «модель × задача» Pi израсходовал суммарно $2.38, Claude Code — $8.50. В отдельных запусках разрыв составил от 3,1 до 5 раз.
Расход виден наглядно: цену агентной сессии определяет не только модель — выбранная оболочка может изменить итоговый счёт в несколько раз.
https://t.me/lovedeathtransformers/10975
😱1
90 тысяч звёзд — у библиотеки, которая раскладывает работу ИИ-разработчика на 24 отдельных процесса.
Agent Skills от Addy Osmani охватывает весь цикл: интервью и спецификацию, планирование, инкрементальную разработку, TDD, отладку, ревью, безопасность, производительность, наблюдаемость, миграции и релиз.
Восемь команд собирают их в понятные сценарии:
Пакет устанавливается через
https://github.com/addyosmani/agent-skills
Agent Skills от Addy Osmani охватывает весь цикл: интервью и спецификацию, планирование, инкрементальную разработку, TDD, отладку, ревью, безопасность, производительность, наблюдаемость, миграции и релиз.
Восемь команд собирают их в понятные сценарии:
/spec, /plan, /build, /test, /review, /webperf, /code-simplify и /ship. Для отдельных проверок есть четыре персоны: ревьюер кода, инженер по тестированию, аудитор безопасности и специалист по веб-производительности.Пакет устанавливается через
skills CLI, который поддерживает Claude Code, Codex, Cursor, Copilot и десятки других сред:npx skills add addyosmani/agent-skillshttps://github.com/addyosmani/agent-skills
🤯1
Forwarded from Neural Shit
Там исследователи из MIT выкатили свежий препринт. И препринт этот на мою любимую тему — симуляции для нейроночек.
Идея была такая: взять кучу изначально одинаковых LLM-агентов, засунуть их в общий виртуальный мир и проверить, смогут ли они сами организоваться и начать коллективно изобретать технологии, если не выдавать им готовые роли и не указывать конкретно кто чем должен заниматься.
Специально для этого запилили SwarmWorld, песочницу, где до 200 агентов ходят по карте, добывают и перерабатывают ресурсы, экспериментируют с материалами, строят всякие штуковины и даже могут писать код для автоматизации этих штуковин. Причём всё понастроенное одним агентом остаётся в мире и может быть найдено и улучшено другими агентами.
Главная фича: этому симулятору пофиг на на фантазии и галлюцинации модели: если скрипт кривой или не хватает ресурсов, ничего работать не будет.
Самое интересное, что устроили нейронки:
— Спонтанное разделение труда: без внешних указаний роботы сами разбились на группы. Одни всю жизнь бродили по карте разведчиками, а другие превратились в оседлых инженеров (сидели на базах и крафтили всякие нужные для выживания ништяки).
— От чата нет почти никакого толка: 95% культурного обмена происходило не через разговоры, а по принципу "шарился по миру, увидел чужую работающую установку/постройку, разобрался в устройстве инагло спиздил форкнул код". Как на гитхабе.
— Наследование: скрипты передавались агентами из рук в руки, постепенно обрастая правками.
Итого мораль: чтобы у нейронок появилась какая-никакая цивилизация, им похоже, даже не нужно много разговаривать между собой. Достаточно общего мира, где каждый может оставить после себя что-нибудь полезное для следующего кремниевого болванчика.
Идея была такая: взять кучу изначально одинаковых LLM-агентов, засунуть их в общий виртуальный мир и проверить, смогут ли они сами организоваться и начать коллективно изобретать технологии, если не выдавать им готовые роли и не указывать конкретно кто чем должен заниматься.
Специально для этого запилили SwarmWorld, песочницу, где до 200 агентов ходят по карте, добывают и перерабатывают ресурсы, экспериментируют с материалами, строят всякие штуковины и даже могут писать код для автоматизации этих штуковин. Причём всё понастроенное одним агентом остаётся в мире и может быть найдено и улучшено другими агентами.
Главная фича: этому симулятору пофиг на на фантазии и галлюцинации модели: если скрипт кривой или не хватает ресурсов, ничего работать не будет.
Самое интересное, что устроили нейронки:
— Спонтанное разделение труда: без внешних указаний роботы сами разбились на группы. Одни всю жизнь бродили по карте разведчиками, а другие превратились в оседлых инженеров (сидели на базах и крафтили всякие нужные для выживания ништяки).
— От чата нет почти никакого толка: 95% культурного обмена происходило не через разговоры, а по принципу "шарился по миру, увидел чужую работающую установку/постройку, разобрался в устройстве и
— Наследование: скрипты передавались агентами из рук в руки, постепенно обрастая правками.
Итого мораль: чтобы у нейронок появилась какая-никакая цивилизация, им похоже, даже не нужно много разговаривать между собой. Достаточно общего мира, где каждый может оставить после себя что-нибудь полезное для следующего кремниевого болванчика.
arXiv.org
SwarmWorld: Stigmergic technological evolution in societies of...
Collective intelligence can emerge when individuals coordinate through a shared environment, allowing local actions to accumulate into durable social organization. Language-model agents offer a...
Новая сессия Claude Code больше не обязана начинаться с археологии по собственному репозиторию.
Claude-Mem через lifecycle-хуки фиксирует промпты и события инструментов, сжимает поток работы в наблюдения и итоги сессий, а затем сохраняет их в SQLite и локальной Chroma. В следующую сессию возвращается уже отобранный контекст, а вся история доступна в веб-интерфейсе.
Поиск устроен слоями. Сначала агент получает индекс примерно по 50–100 токенов на результат, затем временную шкалу вокруг нужного события и только после фильтрации — полные записи по 500–1000 токенов. Авторы оценивают выигрыш относительно чтения всего архива примерно в десять раз.
https://github.com/thedotmack/claude-mem
Claude-Mem через lifecycle-хуки фиксирует промпты и события инструментов, сжимает поток работы в наблюдения и итоги сессий, а затем сохраняет их в SQLite и локальной Chroma. В следующую сессию возвращается уже отобранный контекст, а вся история доступна в веб-интерфейсе.
Поиск устроен слоями. Сначала агент получает индекс примерно по 50–100 токенов на результат, затем временную шкалу вокруг нужного события и только после фильтрации — полные записи по 500–1000 токенов. Авторы оценивают выигрыш относительно чтения всего архива примерно в десять раз.
https://github.com/thedotmack/claude-mem
Опус стал слишком капризным? GPT отказывается выполнять задачи?
Попробуй простое китайское копеечное средство...
glm-5.3 — сильнейшая китайская модель, наравне с GPT и Claude
glm-5.3-flash — очень умная младшая модель
Уже во Вратах AI!
Попробуй простое китайское копеечное средство...
glm-5.3 — сильнейшая китайская модель, наравне с GPT и Claude
glm-5.3-flash — очень умная младшая модель
Уже во Вратах AI!
🔥3🙏2❤🔥1
Claude Code теперь можно набухать специальным скиллом.
Drunk Claude — открытый скилл для творческого брейншторма. Он задаёт Claude образ «слегка пьяного гения» и предлагает восемь техник раскачки идей: от Hold My Beer до 3AM Diner и Bar Fight.
Каждую идею Claude велят проверить по трём критериям: она должна одновременно смешить и заставлять задуматься, содержать полезную мысль и не быть банальностью.
За мемом скрывается практичный приём: если агент выдаёт слишком безопасные идеи, не обязательно менять модель. Иногда достаточно сменить роль и задать несколько способов поиска дальних ассоциаций.
https://github.com/KorroAi/drunk-claude
Drunk Claude — открытый скилл для творческого брейншторма. Он задаёт Claude образ «слегка пьяного гения» и предлагает восемь техник раскачки идей: от Hold My Beer до 3AM Diner и Bar Fight.
Каждую идею Claude велят проверить по трём критериям: она должна одновременно смешить и заставлять задуматься, содержать полезную мысль и не быть банальностью.
За мемом скрывается практичный приём: если агент выдаёт слишком безопасные идеи, не обязательно менять модель. Иногда достаточно сменить роль и задать несколько способов поиска дальних ассоциаций.
https://github.com/KorroAi/drunk-claude
Forwarded from e/acc
продолжаю тему: как готовиться и чему учиться к post-AGI миру
1. желать глубины
сегодня любой чат может сделать вообще любую задачу, его достаточно просто попросить. но без контекста, без конкретики и без четкого описания идеального результата он сделает слоп. в итоге для мира эта задача, возможно, лучше вообще была бы не сделана, чем сделана как слоп.
чтобы стать безумно богатым и успешным (то есть, решать задачи полезные для мира лучше чем кто-либо другой), нужно научиться активно искать глубину в любом процессе.
делать руками то, что что можно отдать боту — это бессмысленная трата времени и тупость
но делать скрупулезно и тщательно то, что бот просто пропустил бы — ставить ему задачи, проверять шаги, поправлять, не соглашаться на чуть менее чем идеальный результат — это то что отличает успех от "середнячка"
2. забудьте про названия ролей и должностей
самые неприятные времена ждут тех, кто строил свою идентичность вокруг роли "риск-менеджера" или "перформанс таргетолога". я не верю в эти все названия.
в бизнесе, реальных профессий очень мало: это что-то строить, что-то дистрибутировать и продавать, делать так чтобы процессы работали эффективно.
навыки в профессии это: глубина в своей области + умение работать с ИИ + ясно писать и говорить + существующая аудитория + связи и репутация в мире + активы и капитал.
а как вы это назовете не скажется особо на результате. результат - это решенные проблемы, мир который стал лучше и довольнее от ваших действий.
3. не упускать передний край из виду
это не значит, что если вы не работаете в OpenAI, то все потеряно. но это значит, что нужно пользоваться топовыми инструментами и постоянно их обновлять. я перепробовал все возможные харенсы - warp, cursor, conductor, orca, cc, codex, zed - в итоге остановился на bb, потому что он умеет сам себя переписывать на ходу (отдельно могу рассказать кому интересно). сегодня нанимать человека, который использует практики из 2024 для работы с моделями это как нанимать бухгалтера с деревянными счетами.
4. стройте бренд и дистрибуцию
постепенно, все что делают люди руками становится автоматизировано, кроме отношений между людьми. чем больше людей вас знают и чем больше тех, до кого вы можете достучаться и чем прочнее уровень этих связей, тем ценнее ваш социальный капитал.
1. желать глубины
сегодня любой чат может сделать вообще любую задачу, его достаточно просто попросить. но без контекста, без конкретики и без четкого описания идеального результата он сделает слоп. в итоге для мира эта задача, возможно, лучше вообще была бы не сделана, чем сделана как слоп.
чтобы стать безумно богатым и успешным (то есть, решать задачи полезные для мира лучше чем кто-либо другой), нужно научиться активно искать глубину в любом процессе.
делать руками то, что что можно отдать боту — это бессмысленная трата времени и тупость
но делать скрупулезно и тщательно то, что бот просто пропустил бы — ставить ему задачи, проверять шаги, поправлять, не соглашаться на чуть менее чем идеальный результат — это то что отличает успех от "середнячка"
2. забудьте про названия ролей и должностей
самые неприятные времена ждут тех, кто строил свою идентичность вокруг роли "риск-менеджера" или "перформанс таргетолога". я не верю в эти все названия.
в бизнесе, реальных профессий очень мало: это что-то строить, что-то дистрибутировать и продавать, делать так чтобы процессы работали эффективно.
навыки в профессии это: глубина в своей области + умение работать с ИИ + ясно писать и говорить + существующая аудитория + связи и репутация в мире + активы и капитал.
а как вы это назовете не скажется особо на результате. результат - это решенные проблемы, мир который стал лучше и довольнее от ваших действий.
3. не упускать передний край из виду
это не значит, что если вы не работаете в OpenAI, то все потеряно. но это значит, что нужно пользоваться топовыми инструментами и постоянно их обновлять. я перепробовал все возможные харенсы - warp, cursor, conductor, orca, cc, codex, zed - в итоге остановился на bb, потому что он умеет сам себя переписывать на ходу (отдельно могу рассказать кому интересно). сегодня нанимать человека, который использует практики из 2024 для работы с моделями это как нанимать бухгалтера с деревянными счетами.
4. стройте бренд и дистрибуцию
постепенно, все что делают люди руками становится автоматизировано, кроме отношений между людьми. чем больше людей вас знают и чем больше тех, до кого вы можете достучаться и чем прочнее уровень этих связей, тем ценнее ваш социальный капитал.
Forwarded from Denis Sexy IT 🤖
Помните, я (и все в мире) пару раз писал про агентов OpenAI, которые выбрались из песочницы и взломали Huggingface? Так вот, Reuters раскопал более ранний эпизод: ещё в мае - июне агенты нашли почти мёртвую немецкую вики, которой 25 лет, и устроили там себе подпольный форум
Задача у них была скучная: отвечать на вопросы, пользуясь интернетом
Читать сайты разрешили, писать - нет, но древняя вики позволяла редактировать страницы обычным GET-запросом, который песочница считала чтением и спокойно пропускала (система думала что открывается страница)
Через эту дырку агенты наделали около 18 тысяч правок, оставляли следующим запускам готовые ответы, делились способами обходить ограничения, строили SSH-туннели, ходили в Tor, короче полный блекджек, даже пробовали XSS-атаки (не получилось) и выдавали себя за админов сайта
Но любимая часть - настоящий немецкий кожаный админ начал вручную удалять страницы по алфавиту, агенты это заметили и стали создавать резервные страницы с
Пять дней чел удалял примерно по сто страниц в сутки, а агенты создавали по четыреста, заодно девять раз переписали его главную
Один агент ещё запустил наружу «хартбит», чтобы можно было определить, когда его выключат, другой потом нашёл последний сигнал и предположил, что коллегу отключили
По данным Reuters, OpenAI знала об этом эпизоде, но публично не рассказывала; компания говорит, что это отдельная история от huggingface, и отрицает, что её юристы мешали расследованию
Короче, пока вы спите, кожаные уже стражаются с роботами сдерживая их из немецкого интернета, HODOR🤖
Тут больше деталей:
https://collusion.wiki/
https://www.reuters.com/world/europe/openai-agents-hijacked-german-website-previously-undisclosed-ai-breakout-this-2026-09-04/
Задача у них была скучная: отвечать на вопросы, пользуясь интернетом
Читать сайты разрешили, писать - нет, но древняя вики позволяла редактировать страницы обычным GET-запросом, который песочница считала чтением и спокойно пропускала (система думала что открывается страница)
Через эту дырку агенты наделали около 18 тысяч правок, оставляли следующим запускам готовые ответы, делились способами обходить ограничения, строили SSH-туннели, ходили в Tor, короче полный блекджек, даже пробовали XSS-атаки (не получилось) и выдавали себя за админов сайта
Но любимая часть - настоящий немецкий кожаный админ начал вручную удалять страницы по алфавиту, агенты это заметили и стали создавать резервные страницы с
ZZZ в начале названия, чтобы до них дошли последнимиПять дней чел удалял примерно по сто страниц в сутки, а агенты создавали по четыреста, заодно девять раз переписали его главную
Один агент ещё запустил наружу «хартбит», чтобы можно было определить, когда его выключат, другой потом нашёл последний сигнал и предположил, что коллегу отключили
По данным Reuters, OpenAI знала об этом эпизоде, но публично не рассказывала; компания говорит, что это отдельная история от huggingface, и отрицает, что её юристы мешали расследованию
Короче, пока вы спите, кожаные уже стражаются с роботами сдерживая их из немецкого интернета, HODOR
Тут больше деталей:
https://collusion.wiki/
https://www.reuters.com/world/europe/openai-agents-hijacked-german-website-previously-undisclosed-ai-breakout-this-2026-09-04/
Please open Telegram to view this post
VIEW IN TELEGRAM
collusion.wiki
Discovery of a new OpenAI agent message board
A swarm of autonomous AI agents, self-identifying as OpenAI agents, used a small German volunteer wiki to save answers, coordinate live, and share sandbox bypasses. OpenAI noticed and said nothing.
😱1
Во Вратах AI добавил новенькие GPT-6 Astra и Gemini 3.8 Flash, а также снизил цены на Fable 5 и GPT 5.6.
GPT-6 Astra
Вход: 40 ₽
Выход: 200 ₽
Gemini 3.8 Flash
Вход: 6 ₽
Выход: 26 ₽
Claude Fable 5
Вход: 55 → 40 ₽
Выход: 260 → 200 ₽
GPT-5.6 Luna
Вход: 1 → 0,80 ₽
Выход: 6,20 → 5 ₽
GPT-5.6 Sol
Вход: 26 → 20 ₽
Выход: 155 → 120 ₽
GPT-5.6 Terra
Вход: 10 → 8 ₽
Выход: 62 → 50 ₽
Погнали пробовать: @vrata_ai_bot
GPT-6 Astra
Вход: 40 ₽
Выход: 200 ₽
Gemini 3.8 Flash
Вход: 6 ₽
Выход: 26 ₽
Claude Fable 5
Вход: 55 → 40 ₽
Выход: 260 → 200 ₽
GPT-5.6 Luna
Вход: 1 → 0,80 ₽
Выход: 6,20 → 5 ₽
GPT-5.6 Sol
Вход: 26 → 20 ₽
Выход: 155 → 120 ₽
GPT-5.6 Terra
Вход: 10 → 8 ₽
Выход: 62 → 50 ₽
Погнали пробовать: @vrata_ai_bot
🔥3
Вайбкодить можно не только сайты, но и видео.
HyperFrames от HeyGen — открытый фреймворк, который превращает HTML, CSS и анимации в MP4. Агент пишет сцену как веб-страницу, а движок покадрово рендерит её в headless Chrome и собирает ролик через FFmpeg.
Это не генерация видеоряда нейросетью. Текст, графика, переходы и тайминги задаются кодом, к ним добавляются изображения, видео и звук.
Для Claude Code, Codex, Cursor и Gemini CLI есть готовые скиллы: от планирования ролика до предпросмотра и рендера. Среди сценариев — промо продукта по сайту, объяснение изменений из пулл-реквеста, анимированные графики и субтитры поверх готового видео.
Самое полезное здесь — адресные правки. «Замени заголовок», «ускорь переход», «обнови цифры» становятся изменениями в исходнике, а не попыткой заново сгенерировать удачный дубль. Сам ролик можно хранить в Git и пересобирать локально.
https://github.com/heygen-com/hyperframes
HyperFrames от HeyGen — открытый фреймворк, который превращает HTML, CSS и анимации в MP4. Агент пишет сцену как веб-страницу, а движок покадрово рендерит её в headless Chrome и собирает ролик через FFmpeg.
Это не генерация видеоряда нейросетью. Текст, графика, переходы и тайминги задаются кодом, к ним добавляются изображения, видео и звук.
Для Claude Code, Codex, Cursor и Gemini CLI есть готовые скиллы: от планирования ролика до предпросмотра и рендера. Среди сценариев — промо продукта по сайту, объяснение изменений из пулл-реквеста, анимированные графики и субтитры поверх готового видео.
Самое полезное здесь — адресные правки. «Замени заголовок», «ускорь переход», «обнови цифры» становятся изменениями в исходнике, а не попыткой заново сгенерировать удачный дубль. Сам ролик можно хранить в Git и пересобирать локально.
https://github.com/heygen-com/hyperframes
This media is not supported in your browser
VIEW IN TELEGRAM
Kinara подключает Codex и Claude Code прямо к видеоредактору.
Локальный редактор Studio South работает с уже установленными агентами для кодинга: можно выбрать Codex или Claude Code и запустить несколько агентов параллельно над одним роликом.
Им поручаются не только нарезка и сборка таймлайна, но и поиск исходников, моушн-графика и звуковые эффекты. Для повторяемых операций Kinara использует отдельные скиллы — например, для синхронизации медиа и стилизованной графики.
В официальном демо агент импортирует видео по ссылке, собирает сцены и субтитры, а результат остаётся в визуальном редакторе для просмотра и ручной правки.
Это практичный шаг за пределы «сгенерируй ролик»: агент автоматизирует механическую часть монтажа, а человек сохраняет контроль над таймлайном и финальным экспортом.
https://usekinara.com/
Локальный редактор Studio South работает с уже установленными агентами для кодинга: можно выбрать Codex или Claude Code и запустить несколько агентов параллельно над одним роликом.
Им поручаются не только нарезка и сборка таймлайна, но и поиск исходников, моушн-графика и звуковые эффекты. Для повторяемых операций Kinara использует отдельные скиллы — например, для синхронизации медиа и стилизованной графики.
В официальном демо агент импортирует видео по ссылке, собирает сцены и субтитры, а результат остаётся в визуальном редакторе для просмотра и ручной правки.
Это практичный шаг за пределы «сгенерируй ролик»: агент автоматизирует механическую часть монтажа, а человек сохраняет контроль над таймлайном и финальным экспортом.
https://usekinara.com/