Извлечение данных из документов SDK для .NET: текст, изображения

GroupDocs.Parser Cloud предоставляет проекту .NET способ читать содержимое сохранённого документа. Вызов указывает имя файла и тип требуемого содержимого, а ответ возвращает текст страниц, вложенные в них изображения или поля метаданных, записанные для файла.

Шаблоны работают с документами, имеющими одинаковую структуру. Позиции полей и области таблиц описываются один раз, затем применяются к каждому счёту, чеку или форме такого типа, поэтому значения возвращаются как именованные результаты, а не как неструктурированный текст, требующий дальнейшего разбора.

Поддерживается более 50 форматов, включая PDF, Word, Excel, PowerPoint, электронные письма, электронные книги, архивы и веб-страницы. Разбор выполняется на сервере, поэтому на машине, с которой делается вызов, не требуется ничего, кроме пакета SDK.

Распространение осуществляется через NuGet, и каждый запрос содержит Client ID вашего аккаунта и его Secret. Оценка проводится в рамках бесплатного пробного периода. Исходный код SDK и исполняемые примеры опубликованы на GitHub для разработчиков, которые предпочитают изучить вызовы перед их использованием.

  • GroupDocs.Parser Cloud для cURL
  • GroupDocs.Parser Cloud SDK для Java
  • GroupDocs.Parser Cloud SDK для PHP
  • GroupDocs.Parser Cloud SDK для Python
  • GroupDocs.Parser Cloud SDK для Ruby
  • GroupDocs.Parser Cloud SDK для Node.js
Начать бесплатную пробную версию

GroupDocs.Parser Cloud SDK облегчает разработчикам .NET парсинг любого документа для извлечения текста, изображений и метаданных в приложениях на основе .NET. SDK (клиент REST API) - самый простой и быстрый способ ускорить разработку. Это позволяет разработчику сосредоточиться исключительно на написании кода, специфичного для проекта, и не беспокоиться о низкоуровневых деталях формирования запросов и обработки ответов. Документы могут быть распарсены с помощью простых в использовании пользовательских шаблонов, содержащих определения полей данных и таблиц. Затем легко извлекать данные, такие как текстовые поля, числа, таблицы, из типичных документов и даже из контейнеров, таких как ZIP-архивы, файлы почты OST/PST, электронные книги, разметки и портфолио PDF.

Часто задаваемые вопросы

Я хочу создать собственное приложение .NET, которое может парсить файлы онлайн?

Посмотрите наш Cloud SDKs для .NET по адресу GitHub, если вам нужен исходный код для разбора файлов в облаке.

Могу ли я бесплатно попробовать GroupDocs.Parser REST APIs на .NET?

Вы можете попробовать GroupDocs.Parser Low-Code .NET APIs без ограничений.

Что может .NET SDK извлечь из документа?

Три типа контента. Текст всего файла или выбранной страницы, изображения, хранящиеся в нём, и метаданные, записанные в нём, такие как автор, название и дата создания. Шаблон добавляет в этот список именованные поля и значения таблиц.

Как работает парсинг на основе шаблонов?

Шаблон описывает, где находятся нужные значения на странице - по позиции, по окружающему тексту или по области таблицы. Применение его к документу с таким макетом возвращает каждое значение под заданным именем, что удобно для счетов-фактур и других повторяющихся форм.

Функции парсера документов REST API

Разбирайте PDF, текстовые документы, таблицы и презентации

Разбирайте файлы шаблонов Microsoft Word, Excel, PowerPoint и OpenDocument

Разбирайте документы и шаблоны с поддержкой макросов для MS Word, Excel и PowerPoint

Извлекайте текстовое содержимое из всего документа

Извлекать текст и изображения из конкретных страниц

Извлекать отформатированный текст, задав режим извлечения

Извлекать текст из документов в ZIP-архивах или электронных письмах

Получать документы из электронных писем, портфолио PDF и хранилищ MS Outlook

Получать количество страниц документа и другую информацию

Извлечение текста из документа по диапазону номеров страниц

GroupDocs.Parser Cloud API предоставляет несколько способов извлечения текста из документов. Вы можете извлекать только текст, извлекать отформатированный текст, задавая режимы извлечения, извлекать из конкретных страниц, задавая диапазон страниц. Пример ниже показывает, как извлечь текст из PDF документа с указанием диапазона страниц.

Разбор документа PDF для извлечения текста из определённых страниц - C# .NET

// Get AppKey and AppSID from https://dashboard.groupdocs.cloud
  string MyAppKey = "";
  string MyAppSid = "";

  var configuration = new Configuration(MyAppSid, MyAppKey);

  var apiInstance = new ParseApi(configuration);
  var fileInfo = new FileInfo
  {
  FilePath = "directory/document.pdf"
  };

  var options = new TextOptions
  {
  FileInfo = fileInfo,
  StartPageNumber = 1,
  CountPagesToExtract = 2
  };

  var request = new TextRequest(options);
  var response = apiInstance.Text(request);

  // For complete examples, visit https://github.com/groupdocs-parser-cloud/groupdocs-parser-cloud-dotnet-samples

Извлечение изображений из документов с помощью бесплатного приложения GroupDocs.Parser

Извлечение изображений из документов с помощью бесплатного приложения GroupDocs.Parser

Ресурсы поддержки и обучения

GroupDocs.Parser Cloud также предлагает отдельный разбор документов SDKs для других языков, перечисленных ниже:

  РУССКИЙ
a49823877