РуководстваКоманда АльфаPDF7 мин чтения

Как конвертировать PDF в HTML (чистые веб-страницы)

Превратите PDF в чистую HTML-страницу: извлеките текст, используйте pdftohtml или Calibre — либо просто встройте PDF. Честно о том, что переживёт конвертацию.

Конвертация PDF-файла в чистую веб-страницу HTML
PDF → HTML: что на самом деле переживёт дорогу

Если вы хотите конвертировать PDF в HTML, честная новость сразу: ни один инструмент не превращает произвольный PDF в чистый адаптивный HTML автоматически. PDF — печатный формат: он хранит «поставь этот глиф в точке x=142, y=380», а не «это заголовок». HTML — его полная противоположность. Любая конвертация — перевод между двумя философиями, и что-то теряется всегда.

Это не значит, что всё сложно. Это значит, что метод нужно выбирать под задачу: чистая разметка, быстрый разовый результат или просто «выложить документ на сайт хоть как-то». Разбираем все три, плюс случай, когда конвертировать не стоит.

Зачем вообще превращать PDF в веб-страницу?

Постоянно всплывают три причины:

  • SEO. Поисковики индексируют PDF, но настоящие HTML-страницы ранжируют куда лучше: у HTML есть структура (заголовки, ссылки, alt-тексты), он быстрее грузится и работает на мобильных. Контент, похороненный в PDF, — это контент, который большинство ищущих никогда не найдёт.
  • Доступность. Скринридеры справляются с семантическим HTML гораздо лучше, чем со средним PDF без тегов. Если документ важен для всех, доступный формат — это HTML.
  • Удобство. Ссылка на PDF на телефоне — это скачать → открыть в другом приложении → щипками масштабировать неподвижный лист A4. HTML-страница просто читается.

Способ 1 — извлечь и пересобрать (самая чистая разметка)

Для контента, который вам действительно важен — отчёт для сайта, руководство, документация — это лучше любого автоматического конвертера. Вы достаёте из PDF сырьё и сами пишете вокруг него простой HTML.

1

Вытащите текст

Загрузите PDF в Извлечь текст. Вы получите весь текстовый контент — бесплатно до 20 МБ и 50 страниц, без регистрации.

Drop PDF here
2

Вытащите картинки

Прогоните тот же PDF через Извлечь изображения — каждое встроенное изображение выйдет отдельным файлом в исходном разрешении, готовым для тегов img.

WebPrintPrepress
3

Разметьте структуру

Вставьте текст в редактор и добавьте семантику, которой в PDF никогда не было: h2 для заголовков разделов, p для абзацев, ul для списков, table где нужно. Это ручная часть — обычно 15-30 минут на 10-страничный документ.

Compressing…69%~2 seconds remaining
4

Верните картинки на место

Добавьте теги img с осмысленными alt там, где стояли иллюстрации. Заодно сожмите изображения для веба.

contract_draft.pdfDownload
5

Публикуйте

Результат — HTML ручного качества: адаптивный, доступный, индексируемый. Ничего из этого автоматический конвертер не даёт.

All done — file readyAuto-deleted in 1 hour

Да, это ручная работа. Но на выходе — HTML, который действительно захочется поддерживать, и для всего, что предназначено живым читателям, этот размен того стоит.

Способ 2 — pdftohtml и Calibre (для любителей командной строки)

Если нужна автоматизация и вы готовы смириться с более грязным результатом:

pdftohtml (часть утилит Poppler; на Linux/Mac предустановлен или ставится одной командой):

pdftohtml -s -noframes document.pdf output.html

Флаг -s даёт один непрерывный HTML-документ вместо файла на каждую страницу. Флаг -c включает «сложный режим», который воспроизводит вёрстку абсолютно позиционированными div-ами — визуально ближе к PDF, но разметка непригодна ни для чего, кроме показа, и полностью разваливается на мобильных.

Calibre (бесплатен, кроссплатформенный) обращается с PDF как с электронной книгой: откройте Calibre → добавьте PDF → «Преобразовать» → выберите вывод HTMLZ. Лучше всего работает на одноколоночных текстовых PDF и спотыкается на многоколоночной вёрстке, которую часто читает в неверном порядке.

Платные конвертеры (экспорт в HTML из Adobe Acrobat Pro, разные онлайн-сервисы за $6-20 в месяц) лучше справляются с таблицами и сохраняют больше форматирования, но их вывод — всё равно сгенерированная разметка: сотни инлайновых стилей и вложенных span-ов. Годится, если контент нужен онлайн сегодня; мучительно, если его когда-нибудь придётся править.

Способ 3 — не конвертировать: встроить или дать ссылку

Иногда правильный ответ на «как выложить этот PDF на сайт» — выложить PDF на сайт:

<embed src="/files/report.pdf" type="application/pdf" width="100%" height="800px" />

Или просто ссылка с указанием размера: <a href="/files/report.pdf">Годовой отчёт (PDF, 2,4 МБ)</a>.

Минусы: встроенные PDF по-прежнему слабы для SEO и неудобны на телефонах. Частый компромисс — и то и другое: HTML-выжимка ключевого контента на странице, а под ней ссылка на полный PDF.

Какой способ подходит вам?

СитуацияЛучший способПочему
Контент надолго поселится на сайтеИзвлечь + пересобратьЧисто, адаптивно, редактируемо, индексируемо
Разовая задача, внутренняя, никто не правитpdftohtml / CalibreБыстро и бесплатно; неопрятность не мешает
Партия из 200 PDF, которые нужно выложитьpdftohtml по скриптуЕдинственный автоматизируемый вариант в таком масштабе
Суть — в фиксированной вёрстке (формы, сертификаты)Встроить или дать ссылку на PDFКонвертация может их только испортить
Скан (изображения страниц)Сначала OCR, потом пересборкаПока не отработал OCR, извлекать нечего — текстового слоя нет
Цель — SEOИзвлечь + пересобратьПоисковики ранжируют структурный HTML, а не позиционированные div-ы

Честные ожидания: что выживет, а что нет

Какой бы способ вы ни выбрали, откалибруйте ожидания:

  • Простой текст: выживает везде. Это лёгкие 90%.
  • Шрифты: обычно заменяются на веб-безопасные или системные, пока вы вручную не подключите веб-шрифты.
  • Многоколоночная вёрстка: классический провал. Конвертеры либо сплющивают колонки в один сбивающий с толку поток, либо замораживают их абсолютным позиционированием.
  • Таблицы: как повезёт. Простые сетки часто конвертируются; объединённые ячейки и вложенные таблицы — почти никогда.
  • Колонтитулы и номера страниц: приезжают мусорным текстом, повторяющимся на каждой «странице», — удалять придётся вручную.
  • Интерактивные поля форм: не переживают ни один конвертер. Пересоберите их как HTML-форму.

Если вам в обратную сторону — есть веб-страница и нужен её PDF — это куда лучше решённая задача: почти каждый браузер делает это через печать в PDF.

~90%
Простого текста переживает любой способ конвертации
15-30 мин
Пересобрать типичный 10-страничный PDF в чистый HTML вручную
0 ₽
Стоимость пути «извлечь и пересобрать» с АльфаPDF и вашим редактором
1 час
До удаления ваших файлов с сервера АльфаPDF

Частые вопросы

Существует ли по-настоящему бесплатный онлайн-конвертер PDF в HTML?

Бесплатные автоматические конвертеры есть, но их вывод — сгенерированная разметка: позиционированные div-ы и инлайновые стили. Действительно бесплатный путь к чистому HTML — извлечь текст и картинки через АльфаPDF (бесплатно до 20 МБ, 10 операций в день, без регистрации) и написать разметку самому.

Мой PDF — скан, извлечение ничего не возвращает. Почему?

Отсканированный PDF — это картинки страниц без текстового слоя внутри. Сначала прогоните его через OCR; после этого извлечение текста работает как обычно. Без OCR ни один конвертер на свете не найдёт текст, которого нет.

Переживут ли конвертацию гиперссылки из PDF?

pdftohtml сохраняет большинство ссылок-аннотаций тегами a. В процессе «извлечь и пересобрать» простое извлечение текста их теряет — важные URL копируйте из PDF вручную по ходу разметки.

Как достать картинки в полном качестве?

Используйте Извлечь изображения — он вытаскивает встроенные оригиналы, а не делает скриншоты страниц, так что вы получаете то разрешение, которое реально хранилось в PDF. Перед публикацией сожмите их для веба.

Google вообще индексирует PDF?

Да — Google индексирует и ранжирует PDF. Но HTML-страницы с тем же контентом стабильно их обгоняют: лучше мобильный опыт, быстрее загрузка, настоящая структура заголовков и внутренние ссылки — всё это работает на ранжирование. Если контент важен для поиска, публикуйте его как HTML.

Умеет ли Word превращать PDF в HTML?

Отчасти. Word открывает многие PDF (Файл → Открыть), переверстывает их в редактируемый документ и умеет «Сохранить как → Веб-страница». HTML у него печально известен раздутостью — годится как отправная точка, но не как боевая разметка.

А если PDF в Markdown вместо HTML?

Часто это умнее. Извлеките текст, добавьте синтаксис заголовков и списков Markdown (набирать быстрее, чем теги) и пусть генератор сайта сам сделает HTML. Тот же процесс, что и в способе 1, но меньше печатать.

Встроенный PDF — это плохо для доступности?

Как правило, да. Поддержка скринридеров внутри браузерных просмотрщиков PDF нестабильна, а PDF без тегов везде читается плохо. Если доступность важна, дайте контент настоящим HTML — хотя бы упрощённую версию рядом со встроенным файлом.

Команда АльфаPDF

Команда АльфаPDF — приватные онлайн-инструменты для PDF: сжатие, конвертация, OCR, подпись и защита. Файлы удаляются через 1 час. О нас →

Читайте также