OCR и компьютерное зрение
OCR нужен, когда текста нет в DOM и нет нормального UI-имени: скан, картинка, canvas, «рисуночная» кнопка. Сначала проверьте DOM и UI Automation — они стабильнее распознавания.
Когда OCR, а когда нет
- DOM — сайт отдаёт HTML. Это основной путь.
- UI — десктоп с Accessible Name / AutomationId. Гайд: UI.
- OCR — пиксели. Капча «как картинка», скан PDF, подпись на скрине.
Капча как сервис (токен, не картинка) — сервисы капчи. Встроенное распознавание картинки: тип 100/101 у recognize_captcha.
Три объекта Vision
Откуда картинка
Страница: webpage→print_screen или печать в PDF print_to_pdf и дальше разбор PDF. Рабочий стол: windows→screenshot.
Масштаб Windows (125–150%) сдвигает координаты. Для UI это уже описано в гайде UI; для OCR лучше снимать область после стабилизации DPI, не «весь экран вслепую».
Tesseract: короткий сценарий
- Сохранить PNG области.
- Сузить алфавит: set_allowed_chars (для цифр —
0123456789). - recognize по пути к файлу.
- Если нужен прямоугольник текста: get_region_by_text.
Поиск: tesseract.
FAQ
Мусор вместо текста. Обрежьте поле, увеличьте контраст, ограничьте символы. Не гоняйте весь скрин главной страницы.
Координаты клика «мимо». OCR дал текст, клик — по региону; проверьте масштаб и что кликаете в том же окне, откуда снимок.
Сбои: хаб ошибок, UI/OCR.