Зачем конвертировать PDF в Excel
Данные в таблицах PDF, которые вы хотите редактировать, вычислять, анализировать, но в PDF их нельзя изменить. Конвертируя в Excel, можно использовать формулы, строить графики, сортировать и фильтровать.
Частые случаи:
- Извлечение данных из финансовых отчётов
- Ввод статистических данных
- Организация информации из счетов-фактур
- Сводка данных опросов
Типы таблиц в PDF
Текстовая таблица
Текст таблицы в PDF находится в текстовом слое (можно выделять и копировать). Конвертация относительно проста: извлечь текст + распознать структуру таблицы.
Отсканированная таблица
Бумажная таблица, отсканированная в PDF, по сути изображение. Требует OCR для распознавания текста и структуры линий таблицы. Сложнее.
Таблица без границ
Таблица в PDF не имеет видимых рамок, основана только на выравнивании. Распознавание затруднено, так как нет опорных линий.
Распознавание структуры таблицы
Поток распознавания
- Обнаружить область таблицы: найти позицию таблицы в PDF
- Распознать линии: горизонтальные и вертикальные линии определяют структуру строк и столбцов
- Локализовать ячейки: точки пересечения линий определяют ячейки
- Извлечь текст: текст в каждой ячейке
- Реконструировать таблицу: создать таблицу Excel по строкам и столбцам
Трудности
- Объединённые ячейки: ячейки, занимающие несколько столбцов или строк
- Вложенные таблицы: таблица в таблице
- Таблицы на нескольких страницах: одна таблица на двух страницах
- Пустые ячейки: ячейки без текста
- Наклонённые таблицы: сканирование криво
Текстовый PDF в Excel
Метод
Текстовые PDF имеют текстовый слой, прямое извлечение:
- Прочитать текст и позицию из PDF
- Распознать линии таблицы
- Распределить текст по ячейкам по позиции
- Создать Excel
Точность
- Регулярные таблицы (прямые, без объединений): высокая точность
- Сложные таблицы (объединённые ячейки, вложенные): средняя точность
- Таблицы без границ: низкая точность
Отсканированный PDF в Excel
Требуется OCR + распознавание таблицы
Отсканированные PDF не имеют текстового слоя:
- OCR распознает текст
- Распознаёт структуру линий таблицы
- Распределяет распознанный текст по структуре таблицы
- Создаёт Excel
Сложнее, чем текстовый, точность сильно зависит от качества сканирования и OCR.
Этапы конвертации
1. Определить тип
Попробуйте выделить текст таблицы. Если выделяется — текстовый, если нет — отсканированный.
2. Конвертировать
Используйте инструмент PDF в Excel:
- Загрузите PDF
- Инструмент распознаёт структуру таблицы
- Создаёт файл Excel
- Скачайте
3. Проверка данных
После конвертации обязательно проверьте:
- Данные полны (нет ли пропущенных строк или столбцов)
- Числа правильные (OCR может перепутать 0 с O)
- Структура таблицы верна (не смещены ли строки и столбцы)
- Объединённые ячейки восстановлены
Техники повышения точности
Качество исходного PDF
- Высокая чёткость
- Чёткие линии таблицы
- Без наклона и пятен
Упрощение таблицы
- Избегайте объединённых ячеек (разъедините в исходном документе перед конвертацией)
- Избегайте вложенных таблиц
- Одна таблица на страницу (межстраничные таблицы трудны)
Постраничная конвертация
Конвертируйте каждую страницу отдельно, проверяйте, затем объединяйте. Точнее, чем конвертировать весь PDF сразу.
Проверка чисел
OCR легко путает числа и буквы:
- 0 и O
- 1 и l, I
- 5 и S
- 8 и B
Финансовые данные, номера документов и другие важные числа должны проверяться поштучно.
Использование формул Excel для проверки
После конвертации используйте формулы Excel для проверки корректности данных:
- Правильные ли итоги
- Проценты в диапазоне 0-100%
- Даты разумны
Частые вопросы
Таблица превратилась в plain text
- Сбой распознавания структуры таблицы
- Решение: реконструируйте таблицу вручную в Excel, скопируйте текст
Данные смещены
- Неправильное распределение по ячейкам
- Решение: скорректируйте вручную
Неправильные числа
- Ошибка распознавания OCR
- Решение: проверьте числа поштучно
Межстраничная таблица потеряна
- Одна таблица на двух страницах, распознана только одна
- Решение: объедините данные двух страниц вручную
Объединённая ячейка разделена
- Объединённая ячейка разбита на несколько, данные только в одной
- Решение: объедините вручную или дополните данные
Пустая ячейка потеряна
- Пустая ячейка не распознана, вызвав смещение столбцов
- Решение: сверьтесь с оригинальным PDF и добавьте пустые ячейки
Альтернативы
Ручной ввод
Если таблица небольшая (одна-две страницы), ручной ввод в Excel может быть быстрее и точнее, чем конвертация с проверкой.
Копирование и вставка
Текстовые PDF: выделите текст таблицы и скопируйте, вставьте в Excel. Может потребоваться «текст по столбцам» для организации.
Использование извлечения PDF-форм
Если PDF — форма, используйте инструмент извлечения PDF-форм для прямого извлечения данных полей.
Итог
Конвертация PDF в Excel опирается на распознавание структуры таблицы и извлечение текста. Текстовые проще отсканированных, регулярные таблицы точнее сложных. После конвертации обязательно проверяйте данные, особенно числа. Инструмент PDF в Excel DocsAll работает в браузере, файлы не покидают устройство. Для небольших таблиц ручной ввод может быть эффективнее.