Skip to content
DocsAll
教程

PDF в Excel: извлечение данных и восстановление структуры

DocsAll 团队 · Опубликовано 1 июля 2026 · Обновлено 12 июля 2026
PDFExcelТаблица

Зачем конвертировать PDF в Excel

Данные в таблицах PDF, которые вы хотите редактировать, вычислять, анализировать, но в PDF их нельзя изменить. Конвертируя в Excel, можно использовать формулы, строить графики, сортировать и фильтровать.

Частые случаи:

  • Извлечение данных из финансовых отчётов
  • Ввод статистических данных
  • Организация информации из счетов-фактур
  • Сводка данных опросов

Типы таблиц в PDF

Текстовая таблица

Текст таблицы в PDF находится в текстовом слое (можно выделять и копировать). Конвертация относительно проста: извлечь текст + распознать структуру таблицы.

Отсканированная таблица

Бумажная таблица, отсканированная в PDF, по сути изображение. Требует OCR для распознавания текста и структуры линий таблицы. Сложнее.

Таблица без границ

Таблица в PDF не имеет видимых рамок, основана только на выравнивании. Распознавание затруднено, так как нет опорных линий.

Распознавание структуры таблицы

Поток распознавания

  1. Обнаружить область таблицы: найти позицию таблицы в PDF
  2. Распознать линии: горизонтальные и вертикальные линии определяют структуру строк и столбцов
  3. Локализовать ячейки: точки пересечения линий определяют ячейки
  4. Извлечь текст: текст в каждой ячейке
  5. Реконструировать таблицу: создать таблицу Excel по строкам и столбцам

Трудности

  • Объединённые ячейки: ячейки, занимающие несколько столбцов или строк
  • Вложенные таблицы: таблица в таблице
  • Таблицы на нескольких страницах: одна таблица на двух страницах
  • Пустые ячейки: ячейки без текста
  • Наклонённые таблицы: сканирование криво

Текстовый PDF в Excel

Метод

Текстовые PDF имеют текстовый слой, прямое извлечение:

  1. Прочитать текст и позицию из PDF
  2. Распознать линии таблицы
  3. Распределить текст по ячейкам по позиции
  4. Создать Excel

Точность

  • Регулярные таблицы (прямые, без объединений): высокая точность
  • Сложные таблицы (объединённые ячейки, вложенные): средняя точность
  • Таблицы без границ: низкая точность

Отсканированный PDF в Excel

Требуется OCR + распознавание таблицы

Отсканированные PDF не имеют текстового слоя:

  1. OCR распознает текст
  2. Распознаёт структуру линий таблицы
  3. Распределяет распознанный текст по структуре таблицы
  4. Создаёт Excel

Сложнее, чем текстовый, точность сильно зависит от качества сканирования и OCR.

Этапы конвертации

1. Определить тип

Попробуйте выделить текст таблицы. Если выделяется — текстовый, если нет — отсканированный.

2. Конвертировать

Используйте инструмент PDF в Excel:

  1. Загрузите PDF
  2. Инструмент распознаёт структуру таблицы
  3. Создаёт файл Excel
  4. Скачайте

3. Проверка данных

После конвертации обязательно проверьте:

  • Данные полны (нет ли пропущенных строк или столбцов)
  • Числа правильные (OCR может перепутать 0 с O)
  • Структура таблицы верна (не смещены ли строки и столбцы)
  • Объединённые ячейки восстановлены

Техники повышения точности

Качество исходного PDF

  • Высокая чёткость
  • Чёткие линии таблицы
  • Без наклона и пятен

Упрощение таблицы

  • Избегайте объединённых ячеек (разъедините в исходном документе перед конвертацией)
  • Избегайте вложенных таблиц
  • Одна таблица на страницу (межстраничные таблицы трудны)

Постраничная конвертация

Конвертируйте каждую страницу отдельно, проверяйте, затем объединяйте. Точнее, чем конвертировать весь PDF сразу.

Проверка чисел

OCR легко путает числа и буквы:

  • 0 и O
  • 1 и l, I
  • 5 и S
  • 8 и B

Финансовые данные, номера документов и другие важные числа должны проверяться поштучно.

Использование формул Excel для проверки

После конвертации используйте формулы Excel для проверки корректности данных:

  • Правильные ли итоги
  • Проценты в диапазоне 0-100%
  • Даты разумны

Частые вопросы

Таблица превратилась в plain text

  • Сбой распознавания структуры таблицы
  • Решение: реконструируйте таблицу вручную в Excel, скопируйте текст

Данные смещены

  • Неправильное распределение по ячейкам
  • Решение: скорректируйте вручную

Неправильные числа

  • Ошибка распознавания OCR
  • Решение: проверьте числа поштучно

Межстраничная таблица потеряна

  • Одна таблица на двух страницах, распознана только одна
  • Решение: объедините данные двух страниц вручную

Объединённая ячейка разделена

  • Объединённая ячейка разбита на несколько, данные только в одной
  • Решение: объедините вручную или дополните данные

Пустая ячейка потеряна

  • Пустая ячейка не распознана, вызвав смещение столбцов
  • Решение: сверьтесь с оригинальным PDF и добавьте пустые ячейки

Альтернативы

Ручной ввод

Если таблица небольшая (одна-две страницы), ручной ввод в Excel может быть быстрее и точнее, чем конвертация с проверкой.

Копирование и вставка

Текстовые PDF: выделите текст таблицы и скопируйте, вставьте в Excel. Может потребоваться «текст по столбцам» для организации.

Использование извлечения PDF-форм

Если PDF — форма, используйте инструмент извлечения PDF-форм для прямого извлечения данных полей.

Итог

Конвертация PDF в Excel опирается на распознавание структуры таблицы и извлечение текста. Текстовые проще отсканированных, регулярные таблицы точнее сложных. После конвертации обязательно проверяйте данные, особенно числа. Инструмент PDF в Excel DocsAll работает в браузере, файлы не покидают устройство. Для небольших таблиц ручной ввод может быть эффективнее.

D
DocsAll 团队 DocsAll 编辑团队

DocsAll 编辑团队,由产品经理、工程师和内容编辑组成,致力于分享实用的办公文档处理技巧。