humanemulator.net — справка. Продукт, демо и покупка — на хуманэмулятор.рф | Демо | Купить | API | лог изменений

Обновлено в августе 2026. · Руководство humanemulator.net

OCR и компьютерное зрение

Теги: OCR UI RPA

OCR нужен, когда текста нет в DOM и нет нормального UI-имени: скан, картинка, canvas, «рисуночная» кнопка. Сначала проверьте DOM и UI Automation — они стабильнее распознавания.

Когда OCR, а когда нет

  • DOM — сайт отдаёт HTML. Это основной путь.
  • UI — десктоп с Accessible Name / AutomationId. Гайд: UI.
  • OCR — пиксели. Капча «как картинка», скан PDF, подпись на скрине.

Капча как сервис (токен, не картинка) — сервисы капчи. Встроенное распознавание картинки: тип 100/101 у recognize_captcha.

Три объекта Vision

Откуда картинка

Страница: webpage→print_screen или печать в PDF print_to_pdf и дальше разбор PDF. Рабочий стол: windows→screenshot.

Масштаб Windows (125–150%) сдвигает координаты. Для UI это уже описано в гайде UI; для OCR лучше снимать область после стабилизации DPI, не «весь экран вслепую».

Tesseract: короткий сценарий

  1. Сохранить PNG области.
  2. Сузить алфавит: set_allowed_chars (для цифр — 0123456789).
  3. recognize по пути к файлу.
  4. Если нужен прямоугольник текста: get_region_by_text.

Поиск: tesseract.

FAQ

Мусор вместо текста. Обрежьте поле, увеличьте контраст, ограничьте символы. Не гоняйте весь скрин главной страницы.

Координаты клика «мимо». OCR дал текст, клик — по региону; проверьте масштаб и что кликаете в том же окне, откуда снимок.

Сбои: хаб ошибок, UI/OCR.

Все руководства · Vision