Новости · PDF и форматы документов

Adobe PDF Services SDK 4.4.0 добавил конвертацию PDF ↔ Markdown в .NET и Python

10 августа 2026 года Adobe выпустила обновления SDK для сервиса PDF Services: .NET SDK 4.4.0 и Python SDK 4.3.0 получили поддержку двусторонней конвертации между PDF и Markdown. Теперь разработчики могут программно извлекать структурированный Markdown из любого PDF и, наоборот, генерировать PDF из Markdown-файлов.

30 августа 2026 Редакция Loadfile Чтение 5 мин
Иконки файлов PDF и Markdown с двусторонними стрелками конвертации — Adobe PDF Services SDK

Коротко: 10 августа 2026 Adobe одновременно выпустила .NET SDK 4.4.0 и Python SDK 4.3.0 для PDF Services. Обе версии поддерживают конвертацию PDF в Markdown (с сохранением заголовков, таблиц и списков) и обратно — Markdown в PDF. Дополнительно расширены опции HTML→PDF и Extract API. Функция PDF→Markdown изначально была анонсирована в феврале 2026 для Node.js и Java; августовский релиз закрывает оставшиеся платформы.

Содержание
  1. Что произошло
  2. Новые возможности SDK
  3. PDF → Markdown: как работает конвертация
  4. Markdown → PDF: обратный путь
  5. Что это значит для работы с документами
  6. Источники

Что произошло

10 августа 2026 года Adobe одновременно обновила два SDK для облачного сервиса Adobe PDF Services: .NET SDK версии 4.4.0 и Python SDK версии 4.3.0. Обе версии вышли в один день с одинаковым набором новых функций.

Adobe PDF Services — это облачный REST API, позволяющий приложениям программно работать с PDF: создавать, конвертировать, объединять, разбивать и извлекать данные из файлов. SDK для .NET и Python предоставляют клиентские обёртки вокруг этого API, упрощая интеграцию в приложения на соответствующих платформах.

Конвертация PDF в Markdown была впервые анонсирована Adobe в феврале 2026 года — тогда функцию добавили в SDK для Node.js и Java. Августовский релиз завершил поддержку всех четырёх официальных платформ: Node.js, Java, .NET и Python. Теперь разработчики на любой из них получают единый API для работы с Markdown как форматом ввода и вывода при работе с PDF.

Новые возможности SDK

Оба SDK — .NET 4.4.0 и Python 4.3.0 — получили четыре группы изменений:

  • PDF → Markdown. Новый тип задачи (PDFToMarkdownJob в .NET, аналогичный класс в Python) позволяет конвертировать PDF в структурированный Markdown. Таблицы преобразуются в синтаксис Markdown-таблиц, заголовки разных уровней восстанавливаются как #, ## и т.д., рисунки вкладываются в формате base64.
  • Markdown → PDF. Операция Create PDF расширена поддержкой Markdown как входного формата: теперь можно передать .md-файл и получить корректно свёрстанный PDF.
  • HTML → PDF: параметр includeRenderedHtml. Операция создания PDF из HTML получила новый параметр, позволяющий включать в результат снапшот отрендеренного HTML. Это упрощает отладку конвертации сложных веб-страниц.
  • Extract API: параметры includeHeaderFooter и tagEncapsulatedText. Операция Extract, извлекающая структурированные данные из PDF, получила дополнительные флаги управления: первый отвечает за включение колонтитулов в вывод, второй — за теги инкапсулированного текста (например, сносок и боковых врезок).
Единый API для всех платформ

После августовского релиза конвертация PDF ↔ Markdown доступна во всех четырёх официальных SDK Adobe PDF Services: Node.js, Java, .NET и Python. Код на всех платформах использует идентичную структуру запроса — отличается только синтаксис конкретного языка.

PDF → Markdown: как работает конвертация

Конвертация PDF в текстовый формат — задача нетривиальная: PDF хранит содержимое как набор позиционированных элементов без явной семантики. Adobe PDF Services решает это за счёт Extract API — движка, который анализирует структуру документа и восстанавливает логику.

По документации Adobe, Markdown-вывод сохраняет следующее:

  • Иерархию заголовков — каждый уровень заголовка из PDF становится соответствующим количеством символов # в Markdown.
  • Таблицы — преобразуются в стандартный синтаксис Markdown-таблиц с разделителями |.
  • Маркированные и нумерованные списки — воссоздаются через - и 1. соответственно.
  • Логический порядок чтения — сохраняется даже при многоколоночной вёрстке оригинала.
  • Рисунки и изображения — вкладываются в формате base64 внутри Markdown, без потери при передаче.

Полученный Markdown адаптирован для LLM-пайплайнов и RAG-систем (Retrieval-Augmented Generation): его можно напрямую загружать в векторные базы данных для последующего семантического поиска. Это один из заявленных Adobe сценариев использования — наряду с переносом документов в системы статической генерации сайтов и базы знаний.

Если вам нужно конвертировать PDF в редактируемый формат без кода, наш конвертер PDF ⇄ Word работает прямо в браузере — без установки программ.

Markdown → PDF: обратный путь

Markdown — лёгкий текстовый формат с разметкой: заголовки пишутся через #, жирный текст через **, ссылки через [текст](url). Он широко используется в документации, репозиториях GitHub, базах знаний и генераторах статических сайтов. PDF при этом остаётся стандартом для финального распространения и печати.

Новая операция Markdown → PDF в Adobe PDF Services принимает .md-файл и возвращает корректно оформленный PDF: заголовки превращаются в типографски правильные стили, таблицы — в сетку, код — в моноширинные блоки. Это закрывает типичный сценарий документооборота: написал в Markdown, опубликовал как PDF без ручного переформатирования.

Что это значит для работы с документами

Для разработчиков приложений, работающих с документами, августовские обновления открывают несколько практических сценариев.

Миграция корпоративных PDF в базы знаний. Накопленные архивы PDF-документов — технические руководства, регламенты, отчёты — можно программно перевести в Markdown и загрузить в системы типа Confluence, Notion или собственную документацию на GitHub. Структура при этом сохраняется, ручная переработка не требуется.

Подготовка данных для LLM и RAG. PDF плохо подходит для прямой передачи в языковые модели: модели лучше воспринимают структурированный текст. Конвертация в Markdown, а затем разбивка на чанки — стандартный пайплайн для создания векторных индексов. Adobe сообщает, что в Extract API планируется добавить встроенный chunking-механизм.

Автоматизация создания отчётов. Сценарий «данные → шаблон Markdown → PDF» теперь доступен через единый SDK без промежуточных инструментов: скрипт формирует Markdown из данных, затем вызывает одну операцию API и получает финальный PDF.

Извлечение данных для повторного использования. Расширенные параметры Extract API (includeHeaderFooter, tagEncapsulatedText) дают точнее управлять тем, какие элементы документа попадают в вывод. Это важно для документов со сложной структурой: финансовых отчётов, юридических договоров, технических спецификаций.

Для разовых задач — конвертации единственного файла PDF без написания кода — по-прежнему удобен наш инструмент для работы с PDF прямо в браузере. Тип и структуру неизвестного файла поможет определить инструмент проверки формата по сигнатуре — без загрузки на сторонние серверы.

Источники

Читайте также