Врата AI | Новости
15 subscribers
38 photos
3 videos
39 links
@vrata_ai_bot — бот для покупки дешёвых моделей Claude и GPT за рубли.
Download Telegram
Одна ошибка агента — один короткий скилл, а не ещё сто строк в CLAUDE.md.

Whetstone собрал 24 отдельных SKILL.md, появившихся после конкретных инженерных сбоев. Каждый файл содержит условия активации, одно основное правило, обезличенный пример и финальный чек-лист перед словом «готово».

Среди самых практичных:

prove-the-test-can-fail — намеренно сломать код и убедиться, что тест действительно краснеет;
audit-before-you-build — сначала найти уже существующую реализацию, потом писать новую;
grep-the-blast-radius — искать всех потребителей изменённого контракта по старому имени;
a-memory-is-not-a-trigger — обязательное действие запускать хуком, а не надеяться на память агента;
safe-data-export — добавить и проверить .gitignore до появления чувствительных данных на диске.

Установка в Claude Code:

/plugin marketplace add iamakbarsha1/whetstone
/plugin install whetstone@whetstone-skills

https://whetstone.akbarsha.dev/
Gauntlet прогоняет PR через коллегию из 23 независимых AI-судей — каждый отвечает только за свой класс рисков.

Команда /gauntlet:review принимает текущие изменения, номер PR, отдельный план или RFC, а также весь репозиторий.

Среди направлений — безопасность, архитектура, тесты, зависимости, инфраструктура, доступность, фронтенд, UX и качество файлов инструкций.

https://github.com/jacquardlabs/gauntlet
👀1
bb — это IDE, которую агенты могут достраивать прямо во время работы.

Попросили добавить трекер задач — агент пишет плагин и встраивает панель в интерфейс. По такой же схеме внутри bb работают автоматизации, память, GitHub-интеграция, удалённый доступ и фоновые задания.

В одном интерфейсе можно запускать Claude Code, Codex, Cursor, Pi, OpenCode, Grok, omp и Hermes Agent. Каждый работает через уже оплаченную подписку провайдера, а один агент может создавать и контролировать другие потоки.

Работу необязательно начинать руками: новый поток запускается через CLI из скрипта, cron-задачи или бота в Telegram, Signal и Slack. Получается локальный диспетчер для целой команды кодинг-агентов.

Установка — npx bb-app@latest; macOS поддерживается нативно, Linux AppImage пока в alpha, Windows — через WSL2.

https://getbb.app/
1😱1
Обнаружился баг в Hermes, из-за которого ризонинг не пробрасывается провайдеру.

Выяснилось, что api_mode: chat_completions, который предлагался в готовом конфиге в @vrata_ai_bot, в Hermes вообще не работает с ризонингом на кастомных провайдерах 🤯

Что делать: скопируйте новый конфиг из бота либо поменяйте в ~/.hermes/config.yaml строчку api_mode: chat_completions на api_mode: anthropic_messages.

Во Врата можно ходить и с openai, и с anthropic протоколом любыми моделями (мы всё равно всё конвертируем у себя как надо), поэтому GPT тоже корректно будет работать с этой настройкой.

Пример нового конфига:
custom_providers:
- name: vrata.tg
base_url: "https://api.vrata.tg/v1"
api_mode: anthropic_messages
api_key: "sk-***"
models:
"claude-fable-5":
context_length: 1000000
supports_vision: true
"claude-opus-4-8":
context_length: 1000000
supports_vision: true
"claude-opus-5":
context_length: 1000000
supports_vision: true
"claude-sonnet-5":
context_length: 1000000
supports_vision: true
"gpt-5.6-luna":
context_length: 1050000
supports_vision: true
"gpt-5.6-sol":
context_length: 1050000
supports_vision: true
"gpt-5.6-terra":
context_length: 1050000
supports_vision: true
model:
provider: custom:vrata.tg
default: "gpt-5.6-sol"
Please open Telegram to view this post
VIEW IN TELEGRAM
Помните, в начале года вышел ARC-AGI-3 — интерактивный бенчмарк, где ИИ попадает в незнакомые игры без инструкций, правил и даже сформулированной цели?

Агент должен экспериментировать, сам понять устройство мира и научиться побеждать. На старте люди набирали 100%, а лучшие ИИ-системы — всего 0,51%.

Оказалось, что для прохождения бенчмарка на 100% достаточно всего лишь скилла на 129 строк. Claude Code прошёл все 25 публичных игр ARC-AGI-3 с одним жёстким правилом: сначала предскажи результат действия — потом нажимай.

Перед каждым действием агент обязан передать гипотезу через --predict: какие клетки изменятся, куда сдвинется объект, завершится ли уровень или не произойдёт ничего.

После хода харнесс сравнивает гипотезу с новым состоянием поля, а последовательный план останавливает при первом расхождении — ошибочная модель не успевает сжечь остальные действия.

Получается короткий агентный цикл, который можно переносить далеко за пределы ARC: гипотеза → действие → автоматическая проверка → обновление знаний.

https://github.com/pbshgthm/arc-skill
Управление Mac для ИИ-агента свели к шести примитивам и обычному Python.

Browser Use представила macOS Harness — тонкую прослойку между агентом и системой. Основной интерфейс: see, key, type, click, ax и script.

Через него агент видит окна, отправляет клавиши и клики конкретному процессу, обращается к Apple Accessibility и Apple Events. Browser Harness добавляет доступ к реальному залогиненному Chrome через CDP, а Path и subprocess оставляют под рукой файлы и shell.

Если готового действия нет, агент дописывает недостающую логику прямо по ходу задачи. Никаких отдельных инструментов для Spotify, Slack или Final Cut — возможности растут из обычного кода, а не из бесконечного реестра интеграций.

Самая интересная деталь: Harness умеет снимать окно уже запущенного приложения и отправлять туда ввод, не выводя его на передний план и не двигая физический курсор. Если приложение всё-таки перехватывает фокус, операция останавливается с FocusChangedError.

https://github.com/browser-use/macos-harness
«Пиши короче и человечнее» — хорошее правило для ответа пользователю и плохое правило для работы ИИ-агента.

Кубер Мехта обратил внимание на популярность навыков вроде caveman, i-have-adhd и инструкций в AGENTS.md, заставляющих модели постоянно упрощать язык, убирать детали и оставлять только главное.

Проблема в том, что эти правила действуют не только на финальный ответ. Модель сжимает информацию во время исследования, отладки и передачи задачи другому агенту. Каждое такое сжатие — потенциальная потеря данных.

Вместо:

5/6 PASS · FAIL: test_cache_invalidation · CAUSE: stale key survives restart · REPRO: tests/cache_test.py:184

следующий агент может получить:

«Большинство тестов прошло, но есть одна проблема».

Звучит приятнее. Отлаживать по этому уже нечего.

Предложение автора: внутри агентной системы сохранять схемы, диффы, точные ошибки, уровень уверенности и происхождение фактов. Человечный, короткий и доступный текст генерировать один раз — на границе, где результат читает пользователь.

База данных не хранит информацию в формате дашборда, а компилятор не делает промежуточное представление приятным для чтения. Для агентов логика та же: точное состояние внутри, удобный интерфейс снаружи.

Персонализация здесь ни при чём. Формат «объясни коротко и без перегруза» нужен — просто не как внутренний протокол мышления и общения между агентами.

https://kuber.studio/blog/Reflections/Humanising-LLM-Outputs-is-Actually-Dumb
Одна команда в Claude превращает сложную тему в HTML-страничку без стены текста.

Anthropic выпустил плагин eli5. Он вызывается через /eli5 <topic>, например /eli5 как работает DNS.

На выходе — крупные иллюстрации и минимум слов для человека, который вообще не знаком с темой. Удобный формат для онбординга, документации и быстрых объяснений без отдельной презентации.

https://github.com/anthropics/claude-plugins-community/tree/main/eli5
Одна и та же модель может стоить в пять раз дороже — только из-за выбранной агентной оболочки.

В эксперименте Love. Death. Transformers модели GPT-5.6 Sol и Kimi K3 запускали через Pi, Cline, Hermes Agent, Claude Code, Codex и Ouroboros. Задачи одинаковые: GPU-симуляция трёх тел и решение двумерного уравнения теплопроводности.

На четырёх комбинациях «модель × задача» Pi израсходовал суммарно $2.38, Claude Code — $8.50. В отдельных запусках разрыв составил от 3,1 до 5 раз.

Расход виден наглядно: цену агентной сессии определяет не только модель — выбранная оболочка может изменить итоговый счёт в несколько раз.

https://t.me/lovedeathtransformers/10975
😱1
90 тысяч звёзд — у библиотеки, которая раскладывает работу ИИ-разработчика на 24 отдельных процесса.

Agent Skills от Addy Osmani охватывает весь цикл: интервью и спецификацию, планирование, инкрементальную разработку, TDD, отладку, ревью, безопасность, производительность, наблюдаемость, миграции и релиз.

Восемь команд собирают их в понятные сценарии: /spec, /plan, /build, /test, /review, /webperf, /code-simplify и /ship. Для отдельных проверок есть четыре персоны: ревьюер кода, инженер по тестированию, аудитор безопасности и специалист по веб-производительности.

Пакет устанавливается через skills CLI, который поддерживает Claude Code, Codex, Cursor, Copilot и десятки других сред:

npx skills add addyosmani/agent-skills

https://github.com/addyosmani/agent-skills
🤯1
Forwarded from Neural Shit
Там исследователи из MIT выкатили свежий препринт. И препринт этот на мою любимую тему — симуляции для нейроночек.

Идея была такая: взять кучу изначально одинаковых LLM-агентов, засунуть их в общий виртуальный мир и проверить, смогут ли они сами организоваться и начать коллективно изобретать технологии, если не выдавать им готовые роли и не указывать конкретно кто чем должен заниматься.

Специально для этого запилили SwarmWorld, песочницу, где до 200 агентов ходят по карте, добывают и перерабатывают ресурсы, экспериментируют с материалами, строят всякие штуковины и даже могут писать код для автоматизации этих штуковин. Причём всё понастроенное одним агентом остаётся в мире и может быть найдено и улучшено другими агентами.

Главная фича: этому симулятору пофиг на на фантазии и галлюцинации модели: если скрипт кривой или не хватает ресурсов, ничего работать не будет.

Самое интересное, что устроили нейронки:

Спонтанное разделение труда: без внешних указаний роботы сами разбились на группы. Одни всю жизнь бродили по карте разведчиками, а другие превратились в оседлых инженеров (сидели на базах и крафтили всякие нужные для выживания ништяки).

От чата нет почти никакого толка: 95% культурного обмена происходило не через разговоры, а по принципу "шарился по миру, увидел чужую работающую установку/постройку, разобрался в устройстве и нагло спиздил форкнул код". Как на гитхабе.

Наследование: скрипты передавались агентами из рук в руки, постепенно обрастая правками.


Итого мораль: чтобы у нейронок появилась какая-никакая цивилизация, им похоже, даже не нужно много разговаривать между собой. Достаточно общего мира, где каждый может оставить после себя что-нибудь полезное для следующего кремниевого болванчика.
Новая сессия Claude Code больше не обязана начинаться с археологии по собственному репозиторию.

Claude-Mem через lifecycle-хуки фиксирует промпты и события инструментов, сжимает поток работы в наблюдения и итоги сессий, а затем сохраняет их в SQLite и локальной Chroma. В следующую сессию возвращается уже отобранный контекст, а вся история доступна в веб-интерфейсе.

Поиск устроен слоями. Сначала агент получает индекс примерно по 50–100 токенов на результат, затем временную шкалу вокруг нужного события и только после фильтрации — полные записи по 500–1000 токенов. Авторы оценивают выигрыш относительно чтения всего архива примерно в десять раз.

https://github.com/thedotmack/claude-mem
Опус стал слишком капризным? GPT отказывается выполнять задачи?

Попробуй простое китайское копеечное средство...

glm-5.3 — сильнейшая китайская модель, наравне с GPT и Claude

glm-5.3-flash — очень умная младшая модель

Уже во Вратах AI!
🔥3🙏2❤‍🔥1
Claude Code теперь можно набухать специальным скиллом.

Drunk Claude — открытый скилл для творческого брейншторма. Он задаёт Claude образ «слегка пьяного гения» и предлагает восемь техник раскачки идей: от Hold My Beer до 3AM Diner и Bar Fight.

Каждую идею Claude велят проверить по трём критериям: она должна одновременно смешить и заставлять задуматься, содержать полезную мысль и не быть банальностью.

За мемом скрывается практичный приём: если агент выдаёт слишком безопасные идеи, не обязательно менять модель. Иногда достаточно сменить роль и задать несколько способов поиска дальних ассоциаций.

https://github.com/KorroAi/drunk-claude
Forwarded from e/acc
продолжаю тему: как готовиться и чему учиться к post-AGI миру

1. желать глубины
сегодня любой чат может сделать вообще любую задачу, его достаточно просто попросить. но без контекста, без конкретики и без четкого описания идеального результата он сделает слоп. в итоге для мира эта задача, возможно, лучше вообще была бы не сделана, чем сделана как слоп.

чтобы стать безумно богатым и успешным (то есть, решать задачи полезные для мира лучше чем кто-либо другой), нужно научиться активно искать глубину в любом процессе.

делать руками то, что что можно отдать боту — это бессмысленная трата времени и тупость
но делать скрупулезно и тщательно то, что бот просто пропустил бы — ставить ему задачи, проверять шаги, поправлять, не соглашаться на чуть менее чем идеальный результат — это то что отличает успех от "середнячка"

2. забудьте про названия ролей и должностей
самые неприятные времена ждут тех, кто строил свою идентичность вокруг роли "риск-менеджера" или "перформанс таргетолога". я не верю в эти все названия.

в бизнесе, реальных профессий очень мало: это что-то строить, что-то дистрибутировать и продавать, делать так чтобы процессы работали эффективно.

навыки в профессии это: глубина в своей области + умение работать с ИИ + ясно писать и говорить + существующая аудитория + связи и репутация в мире + активы и капитал.

а как вы это назовете не скажется особо на результате. результат - это решенные проблемы, мир который стал лучше и довольнее от ваших действий.

3. не упускать передний край из виду
это не значит, что если вы не работаете в OpenAI, то все потеряно. но это значит, что нужно пользоваться топовыми инструментами и постоянно их обновлять. я перепробовал все возможные харенсы - warp, cursor, conductor, orca, cc, codex, zed - в итоге остановился на bb, потому что он умеет сам себя переписывать на ходу (отдельно могу рассказать кому интересно). сегодня нанимать человека, который использует практики из 2024 для работы с моделями это как нанимать бухгалтера с деревянными счетами.

4. стройте бренд и дистрибуцию
постепенно, все что делают люди руками становится автоматизировано, кроме отношений между людьми. чем больше людей вас знают и чем больше тех, до кого вы можете достучаться и чем прочнее уровень этих связей, тем ценнее ваш социальный капитал.
Forwarded from Denis Sexy IT 🤖
Помните, я (и все в мире) пару раз писал про агентов OpenAI, которые выбрались из песочницы и взломали Huggingface? Так вот, Reuters раскопал более ранний эпизод: ещё в мае - июне агенты нашли почти мёртвую немецкую вики, которой 25 лет, и устроили там себе подпольный форум

Задача у них была скучная: отвечать на вопросы, пользуясь интернетом

Читать сайты разрешили, писать - нет, но древняя вики позволяла редактировать страницы обычным GET-запросом, который песочница считала чтением и спокойно пропускала (система думала что открывается страница)

Через эту дырку агенты наделали около 18 тысяч правок, оставляли следующим запускам готовые ответы, делились способами обходить ограничения, строили SSH-туннели, ходили в Tor, короче полный блекджек, даже пробовали XSS-атаки (не получилось) и выдавали себя за админов сайта

Но любимая часть - настоящий немецкий кожаный админ начал вручную удалять страницы по алфавиту, агенты это заметили и стали создавать резервные страницы с ZZZ в начале названия, чтобы до них дошли последними

Пять дней чел удалял примерно по сто страниц в сутки, а агенты создавали по четыреста, заодно девять раз переписали его главную

Один агент ещё запустил наружу «хартбит», чтобы можно было определить, когда его выключат, другой потом нашёл последний сигнал и предположил, что коллегу отключили

По данным Reuters, OpenAI знала об этом эпизоде, но публично не рассказывала; компания говорит, что это отдельная история от huggingface, и отрицает, что её юристы мешали расследованию

Короче, пока вы спите, кожаные уже стражаются с роботами сдерживая их из немецкого интернета, HODOR 🤖

Тут больше деталей:
https://collusion.wiki/
https://www.reuters.com/world/europe/openai-agents-hijacked-german-website-previously-undisclosed-ai-breakout-this-2026-09-04/
Please open Telegram to view this post
VIEW IN TELEGRAM
😱1
Во Вратах AI добавил новенькие GPT-6 Astra и Gemini 3.8 Flash, а также снизил цены на Fable 5 и GPT 5.6.

GPT-6 Astra
Вход: 40 ₽
Выход: 200 ₽

Gemini 3.8 Flash
Вход: 6
Выход: 26 ₽

Claude Fable 5
Вход: 55 → 40 ₽
Выход: 260 → 200 ₽

GPT-5.6 Luna
Вход: 1 → 0,80 ₽
Выход: 6,20 → 5 ₽

GPT-5.6 Sol
Вход: 26 → 20 ₽
Выход: 155 → 120 ₽

GPT-5.6 Terra
Вход: 10 → 8 ₽
Выход: 62 → 50 ₽

Погнали пробовать: @vrata_ai_bot
🔥3
Вайбкодить можно не только сайты, но и видео.

HyperFrames от HeyGen — открытый фреймворк, который превращает HTML, CSS и анимации в MP4. Агент пишет сцену как веб-страницу, а движок покадрово рендерит её в headless Chrome и собирает ролик через FFmpeg.

Это не генерация видеоряда нейросетью. Текст, графика, переходы и тайминги задаются кодом, к ним добавляются изображения, видео и звук.

Для Claude Code, Codex, Cursor и Gemini CLI есть готовые скиллы: от планирования ролика до предпросмотра и рендера. Среди сценариев — промо продукта по сайту, объяснение изменений из пулл-реквеста, анимированные графики и субтитры поверх готового видео.

Самое полезное здесь — адресные правки. «Замени заголовок», «ускорь переход», «обнови цифры» становятся изменениями в исходнике, а не попыткой заново сгенерировать удачный дубль. Сам ролик можно хранить в Git и пересобирать локально.

https://github.com/heygen-com/hyperframes
This media is not supported in your browser
VIEW IN TELEGRAM
Kinara подключает Codex и Claude Code прямо к видеоредактору.

Локальный редактор Studio South работает с уже установленными агентами для кодинга: можно выбрать Codex или Claude Code и запустить несколько агентов параллельно над одним роликом.

Им поручаются не только нарезка и сборка таймлайна, но и поиск исходников, моушн-графика и звуковые эффекты. Для повторяемых операций Kinara использует отдельные скиллы — например, для синхронизации медиа и стилизованной графики.

В официальном демо агент импортирует видео по ссылке, собирает сцены и субтитры, а результат остаётся в визуальном редакторе для просмотра и ручной правки.

Это практичный шаг за пределы «сгенерируй ролик»: агент автоматизирует механическую часть монтажа, а человек сохраняет контроль над таймлайном и финальным экспортом.

https://usekinara.com/