При использовании функции «Извлечь текст» чаще всего возникают вопросы о точности распознавания, отсканированных PDF-файлах и форматировании. В этом разделе собраны ответы на 4 частых вопроса и глоссарий из 4 терминов.
Часто задаваемые вопросы
Что делать, если извлеченный текст неточный?
- Проверьте, четкий ли и полный ли исходный PDF-файл.
- Запустите извлечение повторно и выберите более подходящий язык распознавания.
- После извлечения проверьте имена, числа и разрывы абзацев.
- Если файл отсканирован, по возможности попробуйте использовать более четкую версию PDF.
Можно ли извлечь текст из отсканированного PDF-файла?
- Да, отсканированные PDF-файлы можно обрабатывать.
- Откройте функцию «Извлечь текст» и перед началом выберите подходящий язык распознавания.
- После обработки просмотрите распознанное содержимое в области результатов.
- Если результат неудовлетворительный, попробуйте использовать более четкое сканирование и запустите извлечение повторно.
Сохранит ли извлеченный текст исходное форматирование?
- Результат извлечения сохраняет текстовое содержимое и базовую структуру абзацев.
- Сложные макеты, таблицы или многоколоночное содержимое могут потребовать ручной доработки после экспорта.
- Если вы хотите продолжить редактирование, сохранение в формате Word упростит дальнейшую настройку форматирования.
Почему область результатов пуста?
- Убедитесь, что вы нажали «Начать извлечение» и дождались завершения процесса.
- Проверьте, правильно ли выбран диапазон страниц.
- Убедитесь, что ваша учетная запись имеет необходимый доступ по подписке.
- Если страница PDF пуста, повреждена или нечеткая, результат может быть пустым.
Глоссарий
| Термин | Определение |
|---|---|
| OCR | Оптическое распознавание символов — технология, которая преобразует текст на изображениях или отсканированных страницах в доступный для поиска и выделения текст. |
| Диапазон извлечения | Диапазон страниц, используемый для одной задачи извлечения, например все страницы, текущая страница или произвольный диапазон. |
| Язык распознавания | Язык, выбранный перед извлечением, который может влиять на читаемость и качество распознавания. |
| Область результатов | Область, в которой отображается извлеченный текст после обработки; здесь можно скопировать или сохранить результат. |