ИИ Полигон
Тренажёр-песочница для тестирования ИИ-агентов: подключаешь бота по MCP/HTTP, задаёшь роль → симуляция сотен диалогов (обычные/злые/мошенники/джейлбрейк) → карта косяков + датасет для дообучения. РФ-бичхед, приз глобал.
готовS1 · Лендинг2/2
Цель: Показываемый лендинг (тёмный технический SaaS, прайс, форма заявки)
готовS2 · Онбординг + подключение агента6/6
Цель: Регистрация, дашборд, подключение агента по MCP/HTTP, probe-вызов
готовS3 · Роль + канвас сценариев3/3
Цель: Конфигуратор роли (шаблоны+свои поля), канвас, генерация сценариев
готовS4 · Движок прогона10/10
Цель: Реальная симуляция персона↔агент↔судья, cost-gate, red-team
готовS5 · Результат + экспорт3/3
Цель: Дашборд косяков, отчёт, экспорт датасета SFT/DPO, сравнение прогонов
готовS6 · W1 Web QA: матрица и протык8/8
Цель: Прогон веб-приложения без ИИ в рантайме: краулер, ~8 профилей устройств (Chromium+WebKit), layout-audit, фаззер кнопок, скорость, скрины, отчёт в ЛК. Прогоны почти бесплатные.
готовS7 · W2 Web QA: глаза и персоны6/6
Цель: Vision-судья скринов + генерация 3-5 персон × 5-10 сценариев + исполнение browser-use + компиляция стабильных сценариев в Playwright-код (Playwright Agents).
готовS8 · W3 Web QA: MCP и петля4/4
Цель: MCP-сервер Полигона (подключи проект → прогон → отчёт), перепрогон после фикса, наши проекты подключены как демо-кейсы, feature-tester = пульт.
готовS9 · Качество и полировка продукта5/5
Цель: Довести Полигон до крутого качества: закрыть дыры безопасности, убрать незавершённость, дожать фичи.
готовS10 · SaaS-готовность для клиентов19/19
Цель: Довести до уверенного SaaS: витрина под оба продукта, юр-страницы, самотестирование, фиксы найденного.
готовS11 · Взрослый SaaS · Фаза 1 — доверие и безопасность6/6
Цель: Убрать риск навредить клиенту и ложные срабатывания: безопасный фаззер, надёжный судья, крепкий коннектор, свой вход.
готовS12 · Взрослый SaaS · Фаза 2 — реальное покрытие4/4
Цель: Тестировать реальное приложение и реальные действия агента.
готовS13 · Взрослый SaaS · Фаза 3 — вид и стабильность4/4
Цель: Чтобы выглядело и работало как взрослый SaaS.
В РАБОТЕS14 · Backlog — по желанию (после взрослого SaaS)2/4
Цель: Необязательные улучшения, отложены осознанно. Брать по мере надобности.
готовS15 · Прод · Админка (супер-админ)7/7
Цель: Полное понимание и управление: клиенты, расходы, агенты, аналитика, вход в аккаунт клиента.
готовS16 · Прод · Поддержка5/5
Цель: Клиент пишет из кабинета, обращение падает в админку и в Telegram (Лия), отвечаем из админки.
готовS17 · Прод · Юридическое, реквизиты, тарифы6/6
Цель: Легально принимать деньги: политики, оферта, согласие ПДн, реквизиты, финальные тарифы.
готовS18 · Прод · Оплата через Точку + счета5/5
Цель: Выставление счетов юрлицам через банк Точка (по образцу Контент Завода), активация тарифа по оплате.
готовS19 · Прод · Блог + SEO/GEO5/5
Цель: Раздел блог под SEO/GEO, техническое SEO сайта, Метрика+Вебмастер, привести лендинг в порядок.
В РАБОТЕS20 · Прод · Чеклист качества + backlog5/7
Цель: Финальная перепроверка, надёжность судьи (backlog), мониторинг, бэкапы.
Ворклог (места остановки)
Довёл Web QA до рабочего состояния: (1) vision-судья реально покрывает кабинет — прогон под тест-аккаунтом обошёл /dashboard + agents/roles/runs/issues (maxPages>=20 для авторизованных + приоритет ЛК-сидов в краулере); (2) откалибровал vision — был шум (~40 находок, слипся/близко/не центрирован), переписал PROMPT+VERIFY_PROMPT на только явные поломки, проверил перепрогоном шотов: 14 придирок→1 по-делу; (3) починил реальное — cookie-баннер (контраст/отступы/воздух), выровнял пляшущую форму прогона. visionShots считается.
→ Сброс пароля ждёт ящик. Можно поднять качество судьи ещё (модель сильнее gpt-4o-mini) если понадобится.
Добил бэклог: enforcement лимитов на vision-скрины (/api/webqa/runs) и проекты (/api/agents + /api/webqa/projects) — модель подписка+лимиты теперь enforce-ится полностью (диалоги+vision+проекты, 402 при исчерпании). Докрутка тестера: контент-проверки (техтекст/undefined-картинка/дубли), чек-лист vision-судьи, засев входа в ЛК в краулер + приоритет ЛК-сидов (dashboard теперь обходится). Подсказка у поля Инструменты. Фиксы UI: нечитаемые кнопки-переключатели, пляшущая форма прогона, отдельная аватарка Заблуждающегося.
→ Сброс пароля ждёт ящик no-reply@ai-poligon.ru. Можно поднять дефолт maxPages для глубины ЛК-скана.
Внутренний QA под тест-аккаунтом: рега/кабинет/все разделы/Web QA сквозняком/диалоговый прогон — работает (бот 17% готовности, персоны поймали ошибки). Модель биллинга: ПОДПИСКА+лимиты. Убрал клиентские ₽ per-прогон (тайл Потрачено, Стоимость в отчёте, кост-гейт→диалоги). Виджет остатка лимитов (lib/usage.ts + UsagePanel) на Обзоре и Тарифах. visionShots колонка+счётчик. Enforcement live-диалогов в /api/runs (Free=0→402). Починил пустую аватарку Обычного клиента.
→ Enforcement vision-скринов и лимита проектов; подсказка по англ. инструментам; дубль аватарки misinformed; сброс пароля (ждёт ящик).
Web QA прогон по себе: нашёл 18, починил major(overflow-x на статье — word-break), minor(clip в hero лендинга — grid min-width:0 + перенос кнопок), чекбокс регистрации 18px. Обложки 2 старым статьям (webp) — все 5 постов с обложками. Рерайт через RSS для myvision+leadforge (1/день, файлово) с глобальным дедупом источников по 3 сайтам; тематические фиды+фильтры подогнаны.
→ Сброс пароля отложен до ящика no-reply@ai-poligon.ru (задача заведена). Остались косметич. тап-таргеты в подвале legal.
Подключил SEO Контент Завод к ai-poligon.ru: статьи по ключам (Wordstat) и новости из реального RSS (Habr/the-decoder/HF) через ingest в Next-приложение, картинки в webp (292КБ вместо 4МБ/стр), кроны. Активировал кросс-вендор судью (OpenAI+Meta+Mistral) и серверный golden-set. Починил хедер блога и legal: эмблема как на лендинге (был favicon.svg).
→ Прогнать Web QA по себе; обложки 2 старым статьям; сброс пароля + SMTP; решить источник для рерайта топ-конкурентов (нет SERP).
Полигон: закрыт ВЕСЬ роадмап взрослого SaaS (спринты 11/12/13). Добавлено и провалидировано на проде: (1) управление прогонами — поиск/фильтры/история для webqa и диалогов; (2) страница Тарифы + аудит мультитенантной изоляции (IDOR нет, все роуты по orgId); (3) user-simulator для ops (клиент одобряет/отказывает рискованные действия, dual-control); (4) SPA-обход pushState-кликами + краулер захарденен read-only; (5) лог-персоны Sim2Real — загрузка файла логов; (6) калибровка судьи — человеческая сверка %согласия + self-consistency health-check (пересуд 3×). Расход платных прогонов ~8р из 50р.
→ Роадмап взрослого SaaS выполнен целиком. Дальше по желанию: серверный golden-set (сейчас localStorage), кросс-вендорная панель судей, автоплатёж по картам вместо заявки, self-hosted судья/масштаб сервера (были отложены).
Взрослый SaaS Полигон, автономная сессия. ФАЗА 1 закрыта: сетевой read-only guard (не навреди данным клиента), безопасный фаззер, импорт сессии SSO/2FA, надёжный судья (vision verification-pass -33% ложных + голосование 2/3 в диалоге). ФАЗА 2: настоящая ops-песочница AdsWorld (детерминир. мир+фейк-тулы+инварианты budget_overspend/hallucinated_number-по-provenance/paused_live/bid-hike/broken-data, 8/8 детекторов+E2E PASS, вердикт по факту а не LLM) + sitemap-обход краулера. ФАЗА 3: клиентский PDF-отчёт /report/webqa (OWASP/PTES: exec-summary/severity/repro/рекомендации/скрины) + ретраи LLM на 429/5xx. Всё задеплоено на прод ai-poligon.ru и провалидировано. Расход платных прогонов ~9р из 50р.
→ Роадмап (не сегодня): pushState-клики для SPA, user-simulator для ops (многошаг), лог-персоны Sim2Real, управление прогонами (поиск/фильтры), онбординг+тарифы+ревью мультитенантности, калибровка судьи (golden set/kappa) + self-consistency health-check.
Спринт SaaS-готовности закрыт. Адаптив ЛК под мобилу (сайдбар→гориз.полоса, overflow добит везде). MCP-live-агент построен И протестирован своим тест-MCP-агентом (живой прогон через инструмент respond, судья оценил). Функционал подтверждён работой (probe+demo+live+webqa+red-team+MCP). React #418 на settings починен. Полигон = универсальная песочница ЛЮБЫХ агентов (диалог+ops: директолог/авитолог/аналитик), тысячи сценариев (async до 500). Расход валидации ~4р из 50р.
→ Готово к пилотным клиентам на обоих направлениях. Остаётся по желанию: масштабные платные прогоны (по да), контент блога.
Ночь: универсальная песочница агентов доведена (async-движок до 500 сценариев валидирован живьём, red-team, сравнение диалогов, ИИ-авитолог). SaaS: лендинг с Web QA + политика + feature-tester пульт. Dogfood Полигоном себя нашёл и починил 3 бага фичи (аудитор inline-наезды, автологин до гидратации, краулер без сессии) + React #418 на settings. Внутр. самотест обошёл все 10 страниц ЛК под свежим аккаунтом. Расход валидации ~2р из 50р.
→ ГЛАВНОЕ по самотесту: ЛК не адаптивен под мобилу (overflow-x webqa +420px, settings +395px) — отдельная задача, десктоп-первый кабинет. MCP-live-агент (нужен тест-агент). Масштабные платные прогоны по да.
Диалоговое/агентское направление доведено: async-движок (тысячи сценариев без таймаута, tsx-воркер) валидирован живым прогоном; red-team режим (все враждебные) валидирован; сравнение диалог-прогонов (готовность+кластеры) валидировано; ИИ-авитолог ops-песочница добавлена к директологу/аналитику. Универсальная песочница для ЛЮБЫХ агентов (диалоговые + ops). Расход валидации ~2₽ из 50₽ бюджета.
→ MCP-live-агент (нужен тестовый MCP-агент). Скилл feature-tester → пульт к Полигону. Самотестирование (внешнее+внутреннее). Блог опционально.
Спринт качества ЗАКРЫТ. Фаза 3 добита полностью: 3.1 компиляция сценариев в Playwright-код, 3.2 сравнение прогонов (регресс), 3.3 MCP-сервер Полигона (/api/mcp, JSON-RPC, ключи per-org, 5 инструментов Web QA, UI подключения). Всё задеплоено на ai-poligon.ru и проверено сквозняком. Полигон доведён до крутого качества: безопасность закрыта, UX отполирован, три новые фичи. Тестовый мусор с демо-аккаунта почищен.
→ Продукт готов к показу/тестированию. Опционально позже: MCP-агенты в диалоговом направлении live (сейчас только HTTP), Content-Disposition на выгрузках датасета, платная валидация бюджет-режима генераций (ждёт решения владельца). Пользователь сам протестирует Полигон Полигоном.
Инвентаризация продукта (Explore-агент) + Фазы 1-2 доведения до качества. Фаза 1 безопасность: закрыта реальная IDOR-утечка скринов Web QA (были в public/ по угадываемому URL, включая скрины чужих закрытых ЛК) — перенесены за авторизованный роут с проверкой orgId, проверено сквозняком; сессии со сроком+обязательным секретом; пароли аккаунтов зашифрованы AES-GCM; границы ошибок; seed.mjs; включены проверки типов (была 1 ошибка, починена). Фаза 2 UX: навигация в 2 группы, «Данные» из заглушки в рабочий список, дубль блока аккаунтов убран, favicon+OG, техножаргон убран, скелетоны, онбординг с двумя продуктами. Всё задеплоено на ai-poligon.ru и проверено скринами.
→ Фаза 3 (фичи): компиляция сценариев в Playwright-код, сравнение прогонов (регресс), W3 MCP-сервер. Мелочи из инвентаризации: MCP-агенты live (сейчас только HTTP), выгрузки датасета с Content-Disposition.
Фича по запросу владельца: тестовые аккаунты на проекте (несколько ролей), автологин перед прогоном (вся матрица и агент ходят в ЛК), мягкий бюджет продукта для агента (генерации до N руб по ценам UI, оплату не трогать). Валидировано на КЗ: аккаунт new-client (приветственные 100 руб), логин прошел, агент гулял по кабинету. Возможная находка: переключатель Ежемесячно/Ежегодно на /pricing не сработал у агента 3 раза - проверить руками.
→ Ждет решения владельца: бюджет-валидация (агент генерит контент на 100 руб приветственного баланса КЗ = ~30-50 руб себестоимости Kie). Остаток W2: компиляция трейсов в код. W3: MCP.
Агент-исполнитель сценариев построен и валидирован (beta): свой Node-агент вместо browser-use, сценарий формы заявки проходит end-to-end с реальным POST в LeadForge. 3 итерации отладки: goto-URL из любого поля JSON, escape/ретраи, разметка [В МОДАЛКЕ] (после неё прошёл денежный сценарий), scrollIntoView+force-клик (не перевалидирован). Ложный «баг формы /lp/zayavki» разобран вручную — форма живая, у агента были дубли кнопок. Персоны сгенерированы для myvisionagency.ru (5x5). Заведены проекты 24contentzavod.ru и 24leadforge.ru, запущены бесплатные базовые прогоны.
→ Остаток W2: компиляция удачных трейсов в Playwright-код (регресс ~0 руб). Перевалидировать click-fix и vision-промпт v2. Затем W3 (спринт 8): MCP-сервер, регресс-петля, feature-tester как пульт. Разобрать находки прогонов КЗ и LeadForge. Удалить 2 тестовых лида «Тест Полигон» из LeadForge.
W2 наполовину готов: vision-судья скринов (валидирован живым прогоном, 5.58 руб; ловит реальное — склейка заголовков, бледные кнопки; промпт ужесточён после разбора мусорных вердиктов), генератор персон+сценариев по реальной карте сайта (валидирован, 0.05 руб), кост-гейт с калиброванной ценой. Инцидент: деплой во время прогона убил воркер — добавлен авто-провал зависших прогонов. Handoff по вёрстке обоих сайтов передан человеку (Downloads/FIX-verstka-myvision-sites.md).
→ Остаток W2: исполнение сценариев персон агентом (browser-use) + компиляция стабильных сценариев в Playwright-код (Playwright Agents). Затем W3: MCP-сервер, регресс-петля, подключение наших проектов. Перевалидировать vision-промпт v2 следующим платным прогоном.
Запущено направление Web QA. Ресёрч OSS/рынка (5 веток, RESEARCH-LOG §6): берём Playwright + Playwright Agents + browser-use + reg-suit. Построен и задеплоен W1: краулер, матрица 8 устройств (Chromium+WebKit), layout-audit, фаззер, воркер, API, UI отчёта со скринами. Прод-валидация на myvision.su: 40 проверок, 21 реальная находка (горизонтальный скролл на iPhone/iPad/1366). Спринт 6 закрыт.
→ W2 (спринт 7): vision-судья скринов, персоны+сценарии, browser-use, компиляция сценариев в Playwright-код, cost-gate. Плюс: прогнать Web QA по остальным нашим сайтам; починить найденный overflow-x на myvision.su (ждёт решения человека).
Live-движок валидирован на реальном Авито-агенте (готовность 50%, реальные косяки, ~8р). Поправлены баги (бейдж/стоимость live). Построен МОАТ-кирпич: персоны из реальных логов клиента — вставляешь диалоги, LLM извлекает типажи, они кормят генерацию сценариев. Проверено: из 5 Авито-диалогов вытащил 5 реальных типажей.
→ Реальное подключение агента по MCP (не реплика промпта); калибровка судьи на человеке; async-очередь прогонов; фикс-луп (правка промпта из провалов).
Правка: демо было упрощённым. Написан НАСТОЯЩИЙ движок (LLM-генерация сценариев, многотуровый диалог с реальным вызовом агента, LLM-судья с проверками redFlags, учёт стоимости) + cost-gate preview + взрослые отчёты (готовность по уровням) + выгрузки датасет/CSV/JSON. Задеплоено на прод, демо и предпросмотр цены работают. Live ждёт OPENROUTER_KEY + валидирующий прогон за трачу.
→ Включить OPENROUTER_KEY, прогнать маленький валидирующий live-прогон (~2-15р), причесать промпты по результату. Затем сравнение прогонов, симулятор мира ops, очередь.
ЛК задеплоен в прод: https://ai-poligon.ru/login (и /register, /dashboard). nginx на том же домене: / = лендинг, пути приложения проксируются в Next (pm2 poligon-app :3210). Кнопки лендинга заведены в кабинет. Сквозной вход проверен (register ok, dashboard 200).
→ Live-режим прогона за cost-gate; реальный симулятор мира ops; сравнение прогонов.
Достроена УНИВЕРСАЛЬНАЯ механика: EnvironmentDefinition расширен (kind/world/redFlags/events), пресеты чат (поддержка/продажи) и ops (директолог/аналитик), demo-движок ветвится персона↔агент↔судья / событие↔агент↔судья, канвас и результаты обобщены. Прогон директолога ловит «выдумал цифру / сжёг бюджет». Всё в demo (без затрат), проверено скриншотами.
→ Live-режим (OpenRouter) за cost-gate. Сравнение прогонов (регресс). Реальный симулятор мира для ops (сейчас mock-эффекты). Причесать cooperative-персону.