@CommunityManager способы привлечения не актуальны уже для тг, в качестве истории что нибудь напишу.
Новый модуль AI Captcha в BAS: полный разбор, настройка и реальные тесты
-

Если хотите, можно просто посмотреть видео на ютюбе, я прям постарался снял буквально в одном видео обучение + большие тесты, ну и так же старался это все схемами объяснять что бы легче было инфу получать
Так же создал тгк, туда буду свои мысли и интересные моменты закидывать, туда пока майндмапы с ролика и статьи закинул: https://t.me/mustangbas
Ну а здесь в статье будет урезаная версия, только текстом. Сначала разберём, как модуль вообще работает и что у него в настройках, потом покажу чо там с реальными тестами на разных капчах и сравним модели по результату, запросам, токенам и деньгам

Какие капчи я тестил на реальных примерах

Я тут не просто посмотрел настройки и написал, что модуль вроде работает. Я реально запускал его на разных капчах и смотрел, что он сможет решить. Вот что попало в тесты:
- reCAPTCHA v2 26:22
- hCaptcha 33:50
- GeeTest v4 44:51
- Cloudflare Turnstile 50:49
- GeeTest Adaptive 52:29
- GeeTest v3 56:57
- Обычный текст с картинки 1:03:55
- Click captcha 1:05:16
- Rotate captcha 1:08:31
- MTCaptcha 1:12:13
Prosopo я тоже хотел проверить, но нормально протестировать её не получилось, потому что тестовая страница была недоступна
Что вообще делает AI Captcha

Если совсем просто, AI Captcha решает капчу прямо во встроенном браузере BAS. Он делает снимок экрана, отправляет его моделям, получает от них команды и потом уже сам нажимает, перетаскивает объекты или вводит текст
То есть модель сама мышкой не управляет. Она чисто смотрит на картинку и говорит BAS, куда нажать, что куда перетащить или какой текст ввести. А BAS уже всё это делает в браузере
Я тестировал всё это на новой версии BrowserAutomationStudio 30.9.0
Зачем тут вообще две модели

Тут у вас может возникнуть вопрос, зачем модулю вообще две модели. Вроде можно отправить скрин одной модели и пусть она сама всё решает. Но по сути работу здесь разделили, чтобы не гонять дорогую модель по каждой мелочи
-
Вторичная модель смотрит на весь экран браузера BAS. Она ищет капчу, находит её границы, может сама нажать обычную галочку и потом проверяет, решилась капча или нет. Сюда можно поставить модель подешевле, потому что ничего особо сложного она тут не делает
-
Основная модель уже получает саму вырезанную капчу. Вот она как раз должна понять, что там вообще нарисовано и что нужно сделать и как ее решить. Поэтому сюда уже есть смысл ставить более сильную модель
-
Ну и BAS здесь, грубо говоря, просто исполнитель. Он делает снимки, вырезает капчу, проверяет ответ модели, пересчитывает координаты под страницу и потом двигает мышку

Ну и добавлю что основная модель может вернуть три типа действий:
-
clickнажимает в точку с координатамиxиy -
dragперетаскивает объект из точкиfromв точкуto -
typeнажимает на поле и вводит туда текст
Причём за один ответ она может вернуть сразу несколько действий. Например, выбрать несколько картинок и потом ещё нажать кнопку подтверждения. То есть не обязательно каждый клик гонять отдельным запросом
Что я указывал в настройках

Для тестов я использовал OpenRouter. Там удобно то, что можно через одиного провайдера переключать разные модели, для этого вам нужно будет создать там аккаунт и скопировать ключ, в видео я показал как это все делать
В ролике я прям подробно разбирал как работать с опенроутером начиная с регистрации аккаунта: посмотреть в ролике 16:34
Начнем с самых основных параметров в действии решения капчи:
-
Main provider- это провайдер -
Main token- ключ для основной модели -
Main model, это основная модель, которая будет решать капчу -
Secondary provider,Secondary tokenиSecondary model, это всё дублирование первых параметров только для вторичной модели, которая ищет капчу и потом проверяет результат -
Instructions- сюда можно написать модели указания, что за капчу вы решаете и как ее нужно решать
Вот
Instructionsя сначала немного недооценил. На простой капче модель и сама может в целом разобраться. Но когда нужно нажимать объекты по порядку, собирать пазл капчу или понимать непонятную механику, без нормального объяснения она начинает тупить, делать лишние запросы или вообще пишет, что всё готово, хотя капча до сих пор висит, короче инструкции сразу старайтесь писать под ту капчу которую вы решаетеКак добавить модель из OpenRouter

Если нужной модели нет в готовом списке параметра и вы работаете с опенроутером, то открываете её страницу, копируете точный
Model IDи вставляете его в поле модели целиком, как на скрине показалЯ выбрал для этого проекта три основные модели:
-
qwen/qwen3.8-27b:free, бесплатная -
google/gemini-3.8-flash, дешёвая -
anthropic/claude-sonnet-5, дорогая
Но тут надо понимать, что модели и цены постоянно меняются. Какой-то супер мега логики тут не было, просто задача была протестить какая модель что сможет и как в целом работает модуль
Advanced параметры


В вкладке "Дополнительно" настроек много, вот что каждая делает:
-
Main thinkingиSecondary thinkingотвечают за то, насколько сильно модель будет думать над задачей. Сначала можно поставитьlow. Если модель вообще не вывозит, тогда уже пробоватьhighи это реально в многих задача выручало -
Max stepsпо умолчанию стоит 14. Если основная модель дала 14 ответов и так ничего нормально не сделала, действие падает с ошибкой, на каких то капчах поворотах лучше ставить побольше шагов -
Check intervalиStability timeoutнужны, чтобы BAS немного подождал после клика или перетаскивания и не делал новый снимок, пока страница ещё меняеться -
Timeoutограничивает всё действие целиком по времени. По умолчанию там 300 секунд (5 минут) -
API timeoutдаёт одному запросу максимум 60 секунд, если работаете с бесплатными моделями сразу ставьте 120сек, а то и 180 -
API attemptsпо умолчанию стоит 3. Получается один обычный запрос и ещё до двух повторов, если провайдер временно упал -
Main compressionиSecondary compressionсжимают картинки. Чем сильнее сжали картинку, тем меньше токенов ушло, но мелкий текст и отдельные детали модель уже может тупо не увидеть, поэтому тут нужно тестить -
Similarityпомогает BAS понять, перестала страница меняться или ещё нет. По умолчанию там 97 процентов -
SummaryиFull logнужны чисто для отладки.Summaryпоказывает короткую историю действий, аFull logсохраняет полный журнал со снимками и данными страницы -
Resultсохраняется в переменнуюAI_CAPTCHA_RESULT. Там можно посмотреть, сколько было шагов и запросов, сколько ушло токенов и времени -
Reasonсохраняется отдельно вAI_CAPTCHA_REASON. Там лежит короткая причина завершения, напримерmodel_doneилиno_captcha. При этомmodel_doneещё не означает, что сайт реально принял капчу, поэтому после действия лучше отдельно проверить страницу
Как вообще это все работает пошагово

По сути всё работает вот так:
-
BAS делает снимок браузера
-
Вторичная модель смотрит, есть ли там капча и где она находится
-
Если там просто галочка, вторичная модель может сама её нажать
-
Если открылось задание, BAS вырезает капчу и отправляет основной модели
-
Основная модель возвращает клики, перетаскивания или текст
-
BAS всё это выполняет и ждёт, пока страница перестанет меняться
-
Потом делается новый снимок и всё проверяется ещё раз
Вот так оно и крутится по кругу. Заканчивается всё тогда, когда капча исчезла, модель решила, что она готова, вышел общий таймаут или основная модель уже потратила все 14 ответов
Какие капчи модуль вообще может решать

Если капчу можно решить по картинке через клик, перетаскивание или ввод текста, то модуль хотя бы может попробовать. Сюда входят обычные галочки, выбор картинок, текст с изображения, слайдеры, поворот картинки, drag-and-drop и клики по объектам в нужном порядке
Аудиокапчи и невидимые капчи по типу recaptcha_v3 он понятное дело не решает
С динамической hCaptcha у меня были частичные успехи, но стабильно она так и не решалась. Там, например, была капча, где оса летала по цветкам, а потом, типа, нужно было выбрать тот цветок, на который она ни разу не села
И вот тут модель уже начинала тупить, потому что ей приходят отдельные картинки, а не видео. То есть нормально проследить, куда эта оса там садилась, она просто не могла. Короче, может быть, если долго сидеть, писать нормальные инструкции и гонять разные модели, это и можно дожать, но с ходу и просто такие капчи вряд-ли получиться решать, если вообще это реально модулем

Что вышло по моделям

Если брать сохранённые запуски, где основная модель вообще вызывалась, получилось вот так:
-
Qwen 3.8 27B free сделала 19 запросов, съела 49 952 токена и стоила $0
-
Gemini 3.8 Flash сделала 44 запроса, съела 104 095 токенов и стоила $0.097
-
Claude Sonnet 5 сделала 92 запроса, съела 306 285 токенов и стоила $0.628
В эти деньги входит не только основная, но и вторичная модель внутри каждого запуска. Turnstile я сюда не добавлял, потому что там основная модель вообще не вызывалась
И вот тут началось самое интересное. Claude Sonnet 5 быстро понимала картинку и вроде нормально понимала, что от неё хотят. Но координаты она иногда давала просто нереально плохие. В итоге более дешёвая Gemini 3.8 Flash на пазлах GeeTest у меня отработала лучше
Короче, чисто поставить самую дорогую модель и ждать, что она сейчас всё порешает, не получится. Нужно брать конкретную капчу и смотреть, какая модель именно на ней работает нормально
Что было с каждой капчей

-
reCAPTCHA v2: тут особо ничего интересного не было, обычный выбор картинок. Все три модели её решили
-
hCaptcha: со статичными заданиями Gemini и Claude иногда справлялись, поэтому у них стоит частичный результат. Как только появлялись адаптивные капчи, то там все ломалось и результат был слабым, но там супер много разных типов капч, я думаю большую часть этот модуль решит, но вот с капчей осой это мне кажеться нереально)))
-
GeeTest v4 и GeeTest v3: бесплатная Qwen вообще не вывезла. Claude вроде понимала сам пазл, но потом присылала херовые координаты и ползунок ехал не туда. Gemini смогла собрать пазл, причём GeeTest v4 я потом прогнал ещё раз и она снова справилась
-
Cloudflare Turnstile: тут вообще всё просто. Вторичная модель сама нажала галочку и проверила результат. Основная модель даже не понадобилась
-
GeeTest Adaptive: Gemini решила. Claude выбирала правильные элементы, но кликала немного мимо и всё ломалось. Бесплатная модель сначала вообще не увидела капчу, а потом ещё словила лимит бесплатного пула
-
Текст с картинки и MTCaptcha: прошли все три модели. Там особо нечего разбирать, модель распознала символы, ввела их в поле и всё
-
Click captcha: Qwen иногда начинала правильно, но потом ошибалась, поэтому у неё получился только частичный результат. Gemini и Claude в сохранённых запусках справились
-
Rotate captcha: по сути, она съела больше всего денег. Бесплатная модель запуталась, Gemini дошла до таймаута, а Claude в итоге решила. Но даже у неё было дофига повторных проверок, а два сохранённых запуска в среднем вышли примерно по $0.145
Было 10 типов капчи, 161 запрос к моделям и 474 965 токенов. По деньгам эти сохранённые запуски вышли примерно на ~$0.727. Это не супер точные цифры, но приблизительно, в целом на весь этот проект ушло 3$, это 80-100 разных капч, на 3-ех моделях, потому что много чего закадром было и переснимал
Какие советы и знания я могу дать в результате

Самая дорогая модель вообще не обязательно будет лучшей. Claude быстрее понимала задания, но координаты у неё были херовые, поэтому всё ломалось. Gemini стоила дешевле и на нескольких пазлах просто отработала лучше
Инструкции тоже реально решают. Если кинуть модели странную капчу и ничего не объяснить, она может долго сидеть, думать, путать порядок и жрать запросы. Поэтому я бы сразу нормально писал, что там нужно выбрать, куда перетащить и когда нажать подтверждение, объясняйте все буквально как маленькому ребенку
С thinking я бы делал просто. Сначала ставим
lowи смотрим, вывозит модель или нет. Если она тупит, тогда уже пробуемhigh. Сразу везде ставитьhighсмысла особо нет, потому что это лишнее время и токены могут бытьНу и одного действия AI Captcha в реальном проекте, скорее всего, будет мало. У меня во время тестов вылетали ошибки провайдера, приходили
invalid actions, модели давали кривые координаты или слишком рано решали, что всё готово. Поэтому нужен обработчик ошибки, несколько ограниченных повторов и обычная проверка страницы после капчиБесплатные модели тоже можно использовать, просто надо сразу быть готовым к головняку. Простые текстовые капчи, reCAPTCHA и Turnstile они у меня решали. Но бесплатный пул OpenRouter иногда был забит, прилетала ошибка 429 и простая капча могла растянуться на несколько минут. Чисто попробовать модуль можно, а вот для постоянной работы я бы уже смотрел на более стабильные модели
Что по итогу
В общем, сам модуль мне понравился. Тут нет привязки к одному обычному сервису распознавания, можно брать разные модели и смотреть, какая лучше подходит под конкретную капчу
Тут стоит понимать, что это не одна кнопка, типа нажал и оно само всё решило. Нужно реально сидеть и тестировать: пробовать разные модели, менять инструкции, переключать режим мышления
lowиhigh, смотреть, где всё ломается, и запускать ещё раз. По большей части результат здесь зависит именно от тестов, потому что одна модель может нормально решать одну капчу и вообще не вывозить другуюВсё, что касается самого действия и его настроек, я проверял на BrowserAutomationStudio 30.9.0. Модели, цены и состояние бесплатного пула были такими именно на момент моих тестов
-
R Roy Mustang deleted this topic
-
R Roy Mustang restored this topic
-
@Roy-Mustang said in Новый модуль AI Captcha в BAS: полный разбор, настройка и реальные тесты:
Тут стоит понимать, что это не одна кнопка, типа нажал и оно само всё решило. Нужно реально сидеть и тестировать: пробовать разные модели, менять инструкции, переключать режим мышления low и high, смотреть, где всё ломается, и запускать ещё раз. По большей части результат здесь зависит именно от тестов, потому что одна модель может нормально решать одну капчу и вообще не вывозить другую
Спасибо за такой фундаментальный разбор! Видео пока не смотрел, прочитал текстовую часть. После твоего описания я позволил себе немного дать волю фантазии.
В проектах с обычным программированием я стараюсь обкладывать цикл «попробовал → проверил → разобрал ошибки → повторил» кастомными skills, harness и проверками. Судя по разбору, в модуле уже есть инструкции и подробные логи. Внешняя обвязка могла бы помочь автоматизировать целые серии экспериментов: сравнивать модели, инструкции и режимы мышления в одинаковых условиях, собирать статистику и переиспользовать удачные процедуры.
Сразу оговорюсь: это гипотеза. Сам я такую интеграцию ни разу не делал и даже пока не добрался подробно посмотреть, что нового появилось в BAS.
В предлагаемой схеме на каждую новую независимую задачу BAS адаптер запускает отдельную сессию агента Codex или Claude Code. Последующие обращения этой задачи продолжают её сессию. Следующая независимая задача получает новую отдельную сессию.
Представляю примерно такую логику:
Новая задача BAS → локальный API-адаптер → запуск отдельной сессии агента → передача картинки, инструкций и контекста → работа агента с кастомными skills → анализ картинки и подготовка результата Ответ агента → адаптер проверяет и преобразует ответ → BAS получает его в ожидаемом формате → BAS выполняет действия Следующий шаг этой же задачи → запрос направляется в её существующую сессиюВ качестве основы можно использовать готового агента через Codex SDK или Claude Agent SDK. Картинку анализирует модель с поддержкой изображений, а skills задают процедуры работы и использования доступных инструментов.
При этом пока совершенно непонятно, как адаптер будет отличать запрос новой задачи от продолжения предыдущей. Нужно изучить содержимое запросов BAS, наличие идентификаторов и способы определить начало и завершение задачи. Возможно, эту информацию придётся передавать отдельно. Также потребуется различать обращения к основной и вторичной модели: у них разные роли и входные данные.
Для многопотока предполагались бы параллельные независимые задачи, каждая со своей сессией. Адаптер управлял бы очередью и распределением запросов. На время каждого эксперимента фиксировались бы версии skills, инструкции и настройки, а логи и рабочие файлы хранились бы отдельно.
Для оценки результата потребуется обратная связь от BAS или браузера: ответ модели ещё не означает, что действия выполнились правильно и сайт принял капчу. Как ты и отметил, одного
model_doneнедостаточно.Harness мог бы собирать эти результаты вместе со временем, расходами и неудачными попытками. После серии прогонов агент анализировал бы ошибки и предлагал изменения, которые проверялись бы следующей отдельной серией тестов.
Причём сравнивать стоило бы и с текущим вариантом работы модуля BAS — по успешности, задержкам и полной стоимости. Тогда стало бы понятно, какую практическую пользу даёт дополнительный агентный слой и оправдывает ли она сложность такой обвязки.
P.S.
Прошу воспринимать все написанное исключительно как фантазию, а не руководство к действию, так как надо все допущения валидировать. -
Отличный разбор, было очень интересно!
-
@sergerdn афигеть, я чот даже про это не подумал честно говоря, так бы и это постарался затестить, но это очень умная идея как автоматизировать все эти тесты и получить по итогам результат, очень умно, надо где то будет такое применить и дать фидбек
Просто там видос на полтора часа, мне пока навыков не хватает как делать на 20-30минут ролики когда инфы прям очень много, но я это постараюсь пофиксить
-
@spacerange Пожалуйста, а по статье может есть какие-то замечания, может лучше было ее разделить, или чото убавить? Просто что бы потом не читать заново не удобный текст
-
@Roy-Mustang хорошо всё, сделай скрины только помельче если есть такая возможность
-
@Roy-Mustang said in Новый модуль AI Captcha в BAS: полный разбор, настройка и реальные тесты:
Пожалуйста, а по статье может есть какие-то замечания, может лучше было ее разделить, или чото убавить? Просто что бы потом не читать заново не удобный текст
Я видео смотрел, да в целом все хорошо, мне не хватило только сравнения с другими моделями, так как уже на середине видео было ясно что сонет не очень хорошо справляется с капчами где нужно что нибудь перетягивать. Видно что он правильно разгадывает, но по итогу срабатывает какое - то смещение от нужной позиции. Вот интересно было бы собрать такой рейтинг моделей которые справляются лучше всего с конкретными капчами за свою стоимость.
-
@Roy-Mustang said in Новый модуль AI Captcha в BAS: полный разбор, настройка и реальные тесты:
Просто там видос на полтора часа, мне пока навыков не хватает как делать на 20-30минут ролики когда инфы прям очень много, но я это постараюсь пофиксить
Попросить AI "порезать" сценарий?
-
@sergerdn Попробую сделать, но то как я делал это просто показывать вживую, а можно делать какие-то закадровые объяснения и тд, в общем я пока полный 0 в монтаже, но учитывая что каналы не токо по басу буду делать то конешн со временем всему обучусь, тем более мне нравиться учить новые направление, это конешн тяжело но а шо поделать если нада
-
@spacerange Это можно сделать и притянуть еще идею Сергея, покумекаю короч, то щас еще есть одно видео по басу