Форматы
Как конвертировать PDF в Word
Как перевести PDF в редактируемый документ Word — онлайн, в Acrobat и LibreOffice, в том числе сканы через распознавание текста.
Сфотографировали страницу книги, получили скан договора или PDF без текстового слоя — а скопировать оттуда ни строчки нельзя. Задачу решает OCR: технология превращает картинку с буквами в редактируемый текст. Разбираем, как распознать текст бесплатно онлайн, офлайн-программами и прямо на телефоне — и как получить результат без опечаток.

Распознавание текста нужно каждый раз, когда информация «заперта» в картинке: скан паспорта, фото доски с лекции, старый PDF, отсканированная квитанция. Глазами прочитать можно, а выделить и скопировать — нет. Ниже — все рабочие способы вытащить текст, от онлайн-сервиса на один клик до офлайн-программ для конфиденциальных документов.
Коротко: OCR (оптическое распознавание символов) превращает изображение с текстом в редактируемый текст. Для разовой задачи загрузите фото или PDF в бесплатный онлайн-сервис — за секунды получите текст для копирования. Для документов с личными данными используйте офлайн-программу (например, бесплатную PDF24 или платный FineReader), чтобы файл не ушёл на чужой сервер. На телефоне текст распознаёт встроенный «Google Объектив». Точность зависит от качества снимка: ровный кадр, хороший свет и фокус — половина успеха.
OCR (Optical Character Recognition, оптическое распознавание символов) — это технология, которая находит на изображении буквы и цифры и преобразует их в машинный текст. Для компьютера фотография документа — это просто набор пикселей: он «видит» картинку, но не понимает, что на ней написано. OCR анализирует форму каждого символа, сопоставляет её с известными буквами алфавита и собирает из них слова и строки, которые уже можно выделить, скопировать и отредактировать.
Современные движки распознавания (например, открытый Tesseract от Google или коммерческий ABBYY) используют нейросети и распознают не только печатный текст, но и таблицы, колонки и даже рукописные пометки. Поддерживается более 100 языков, включая русский; многие сервисы распознают несколько языков в одном документе.
Важно различать два типа файлов. Растровое изображение (JPG, PNG, скан в PDF) — это «фотография» текста без текстового слоя, и без OCR скопировать из него ничего нельзя. Текстовый PDF, созданный из Word или экспортом, уже содержит буквы как символы — там распознавание не нужно, текст выделяется сразу. Если вы сомневаетесь, что за файл перед вами, поможет статья как определить формат файла без расширения.
Самый быстрый способ для разовой задачи — онлайн-сервис OCR. Ничего устанавливать не нужно: вы загружаете фото или PDF прямо в браузере, а через несколько секунд получаете готовый текст, который можно скопировать или скачать в файл. Такие сервисы бесплатны, работают с JPG, PNG и PDF и обычно поддерживают распознавание русского языка.
Если после распознавания нужно получить документ Word, ищите в сервисе экспорт в DOCX, а не только копирование текста — так сохранится хотя бы базовое форматирование. Для готового результата удобно связать OCR с обычной конвертацией: сначала распознать, потом при необходимости перегнать в нужный формат через онлайн-конвертеры файлов.
У онлайн-способа есть два ограничения. Первое — лимиты: бесплатные сервисы часто ограничивают число страниц или файлов в день. Второе, и более важное, — приватность: файл уходит на чужой сервер, поэтому договоры, паспорта и медицинские документы так распознавать не стоит (подробнее — в разделе о безопасности).
Когда документ конфиденциальный или страниц много, надёжнее распознавать текст на своём компьютере — файл никуда не уходит. Вот проверенные варианты.
| Программа | Платформа | Цена | Особенности |
|---|---|---|---|
| ABBYY FineReader | Windows, macOS | Платно | Эталон точности для русского языка, отлично держит таблицы и вёрстку |
| PDF24 Creator | Windows | Бесплатно | Есть встроенный OCR для сканов PDF, всё локально |
| Tesseract OCR | Windows, macOS, Linux | Бесплатно | Открытый движок, работает из командной строки, 100+ языков |
| gImageReader | Windows, Linux | Бесплатно | Графическая оболочка для Tesseract, удобна для новичков |
| OneNote (Microsoft) | Windows | В составе Office | Функция «Копировать текст из рисунка» по клику правой кнопкой |
Для большинства бытовых задач бесплатной PDF24 или связки Tesseract + gImageReader более чем достаточно. FineReader стоит денег, но остаётся лучшим выбором, если важна максимальная точность на русском, сложные таблицы или большие объёмы сканов.
Если у вас установлен Microsoft OneNote, вставьте картинку с текстом на страницу, кликните по ней правой кнопкой и выберите «Копировать текст из рисунка». Отдельная программа не нужна.
Смартфон распознаёт текст прямо на месте — например, чтобы переписать номер с визитки или скопировать абзац из бумажной книги. Отдельные приложения обычно не нужны, всё встроено.
Мобильное распознавание удобно для коротких фрагментов. Если нужно вытащить текст из длинного многостраничного скана, точнее и быстрее сделать это на компьютере офлайн-программой.
Частый случай: пришёл PDF, но текст в нём не выделяется — значит, это скан, «картинка» внутри PDF-обёртки. Чтобы сделать такой файл текстовым (с возможностью поиска и копирования), его нужно прогнать через OCR.
После этого по документу заработает поиск, а текст можно будет копировать. Если дальше нужно перевести распознанный PDF в редактируемый документ, пригодятся отдельные гайды: как конвертировать PDF в Word и как конвертировать PDF в Excel (для таблиц).
Если PDF-скан повреждён или не открывается вовсе, распознавание не поможет — сначала восстановите сам файл. Как это сделать, описано в статье как восстановить повреждённый PDF.
OCR ошибается не на пустом месте: чаще всего виноват плохой исходник. Качество распознавания напрямую зависит от того, насколько чётко видны буквы на изображении. Несколько простых правил заметно снижают число опечаток.
Даже при идеальном исходнике распознанный текст стоит вычитать: OCR может перепутать похожие символы — ноль и букву «О», единицу и «I», русскую «с» и латинскую «c». Особенно внимательно проверяйте цифры в реквизитах, суммах и датах.
Онлайн-распознаватели удобны, но каждый загруженный файл уходит на чужой сервер, и вы не контролируете, что с ним происходит дальше. Для повседневных задач — фото конспекта, рецепта, цитаты из книги — это не проблема. А вот документы с персональными и финансовыми данными так распознавать рискованно.
Сканы паспорта и других удостоверений, договоры, медицинские справки, банковские выписки, документы с адресами и телефонами. Такие файлы распознавайте только офлайн-программой на своём компьютере.
Общее правило: если документ вы не готовы отправить незнакомому человеку, не отправляйте его и в онлайн-сервис. Для конфиденциальных файлов офлайн-OCR (PDF24, FineReader, Tesseract) полностью решает вопрос — данные не покидают устройство. Больше о безопасной работе с документами — в разделе безопасность файлов.
Да. Онлайн-сервисы OCR распознают текст с JPG, PNG и PDF бесплатно и без регистрации. Офлайн бесплатно это делают PDF24 Creator, открытый движок Tesseract и его оболочка gImageReader, а на телефоне — встроенные «Google Объектив» (Android) и «Живой текст» (iPhone).
Перед запуском обязательно выберите в настройках сервиса или программы язык «русский». Если оставить английский, распознаватель заменит кириллицу похожими латинскими буквами, и текст выйдет с ошибками. Многие движки умеют распознавать русский и английский одновременно — это удобно для смешанных документов.
Чаще всего из-за качества снимка: блики, тени, наклон камеры, смазанность или низкое разрешение. Переснимите документ при хорошем свете, держа камеру параллельно листу, и укажите правильный язык. Идеального результата без вычитки OCR почти никогда не даёт — цифры и реквизиты проверяйте вручную.
Проверьте, выделяется ли текст курсором. Если нет — это скан, и его нужно прогнать через OCR: в PDF24 или FineReader (офлайн) либо в онлайн-сервисе с поддержкой PDF. Сохраните результат как «PDF с возможностью поиска» — под картинкой появится текстовый слой, по которому заработают поиск и копирование.
Для несекретных материалов — да. А паспорта, договоры, справки и выписки лучше распознавать офлайн-программой на своём компьютере: при онлайн-распознавании файл попадает на чужой сервер, и вы не контролируете его дальнейшую судьбу.
Печатный текст распознаётся уверенно, а рукописный — заметно хуже и зависит от почерка. Аккуратные печатные буквы современные нейросетевые движки читают неплохо, но связный курсив пока распознаётся с большим числом ошибок, поэтому результат обязательно нужно вычитывать.
Да. На Android это делает «Google Объектив» (наведите камеру на текст и выделите его), на iPhone — функция «Живой текст» прямо в приложении «Фото» или камере. Отдельные программы устанавливать не нужно.