Перевод бумажных документов в цифровой формат — стандартная задача для любого специалиста. Однако обычный скан — это просто статичная картинка. Чтобы получить возможность копировать, искать и редактировать содержимое, необходимо выполнить распознавание текста (OCR). В этом руководстве мы подробно разберем, как сделать PDF из скана с распознаванием русского текста.
Видеоинструкция
Пошаговая инструкция по созданию PDF с OCR
Шаг 1: Подготовка исходных файлов
Для качественного распознавания русского языка исходный скан должен иметь разрешение не менее 300 DPI. Если вы сканируете документ на МФУ, выберите формат TIFF или PDF без сжатия. Если у вас уже есть готовые изображения (JPEG/PNG), объедините их.
Шаг 2: Распознавание через Adobe Acrobat Pro
Adobe Acrobat — профессиональный стандарт для работы с PDF. Откройте ваш скан в программе и выполните следующие действия:
- Перейдите во вкладку Инструменты и выберите Сканирование и распознавание (Scan & OCR).
- Нажмите кнопку Распознать текст (Recognize Text) -> В этом файле.
- В настройках обязательно выберите язык: Русский (и Английский, если документ содержит иностранные слова).
- Нажмите кнопку Распознать текст.
После завершения процесса вы сможете выделять текст мышкой или искать по нему с помощью комбинации клавиш Ctrl + F. Не забудьте сохранить изменения, нажав Ctrl + S.
Если после распознавания вам потребуется завизировать документ, изучите инструкцию: как поставить электронную подпись в PDF без печати.
Шаг 3: Использование бесплатных онлайн-сервисов (PDF24)
Если у вас нет платного софта, воспользуйтесь бесплатным инструментом PDF24 Creator или его онлайн-версией:
- Перейдите на сайт PDF24 OCR.
- Загрузите ваши сканы или PDF-файл.
- Выберите русский язык в списке доступных словарей OCR.
- Запустите процесс распознавания и скачайте готовый текстовый PDF.
Обратите внимание, что после распознавания размер файла может значительно увеличиться. В таком случае вам пригодится статья: как сжать PDF файл для отправки по почте: инструкция.
Шаг 4: Сохранение со встроенными шрифтами
Чтобы распознанный текст корректно отображался на смартфонах и компьютерах без искажения разметки, важно правильно сохранить документ. Ознакомьтесь с деталями в статье: Как сохранить PDF со шрифтами без замены: инструкция.
Важно: Рукописный русский текст распознается современными OCR-системами крайне плохо. Для достижения 100% точности используйте только печатные документы с четкими шрифтами.
Дополнительно: Автоматизация OCR на Python
Если вам нужно распознать сотни сканов автоматически, можно использовать библиотеку pytesseract. Вот пример простого скрипта:
import pytesseract
from PIL import Image
# Укажите путь к Tesseract-OCR в системе
pytesseract.pytesseract.tesseract_cmd = 'C:/Program Files/Tesseract-OCR/tesseract.exe'
# Открытие изображения и распознавание русского текста
image = Image.open('scan.png')
text = pytesseract.image_to_string(image, lang='rus')
print(text) Частые ошибки / Устранение неполадок
- Вместо русских букв отображаются «кракозябры» (иероглифы): Это проблема кодировки или отсутствия встроенных шрифтов. Убедитесь, что при экспорте активна опция внедрения шрифтов (Subset Fonts).
- Текст распознался, но съехала верстка: Используйте режим распознавания «Редактируемый текст и изображения» вместо «Точное совпадение» в настройках Adobe Acrobat, либо сохраняйте документ как PDF/A.
- Ошибка «Документ содержит защищенный текст»: Если исходный PDF заблокирован от редактирования, OCR выполнить не удастся. Сначала снимите защиту или пересохраните PDF как набор картинок, а затем распознайте заново.
Часто задаваемые вопросы
Можно ли распознать текст на скане бесплатно?
Да, для этого можно использовать бесплатные онлайн-сервисы, такие как PDF24 OCR, или бесплатные программы с открытым исходным кодом, например, PDF-XChange Viewer.
Что делать, если качество скана очень низкое?
Перед распознаванием увеличьте контрастность изображения в любом графическом редакторе и убедитесь, что разрешение файла составляет не менее 300 DPI.








