GroupDocs.Parser Cloud предоставляет проекту .NET способ читать содержимое сохранённого документа. Вызов указывает имя файла и тип требуемого содержимого, а ответ возвращает текст страниц, вложенные в них изображения или поля метаданных, записанные для файла.
Шаблоны работают с документами, имеющими одинаковую структуру. Позиции полей и области таблиц описываются один раз, затем применяются к каждому счёту, чеку или форме такого типа, поэтому значения возвращаются как именованные результаты, а не как неструктурированный текст, требующий дальнейшего разбора.
Поддерживается более 50 форматов, включая PDF, Word, Excel, PowerPoint, электронные письма, электронные книги, архивы и веб-страницы. Разбор выполняется на сервере, поэтому на машине, с которой делается вызов, не требуется ничего, кроме пакета SDK.
Распространение осуществляется через NuGet, и каждый запрос содержит Client ID вашего аккаунта и его Secret. Оценка проводится в рамках бесплатного пробного периода. Исходный код SDK и исполняемые примеры опубликованы на GitHub для разработчиков, которые предпочитают изучить вызовы перед их использованием.
Начать бесплатную пробную версиюGroupDocs.Parser Cloud SDK облегчает разработчикам .NET парсинг любого документа для извлечения текста, изображений и метаданных в приложениях на основе .NET. SDK (клиент REST API) - самый простой и быстрый способ ускорить разработку. Это позволяет разработчику сосредоточиться исключительно на написании кода, специфичного для проекта, и не беспокоиться о низкоуровневых деталях формирования запросов и обработки ответов. Документы могут быть распарсены с помощью простых в использовании пользовательских шаблонов, содержащих определения полей данных и таблиц. Затем легко извлекать данные, такие как текстовые поля, числа, таблицы, из типичных документов и даже из контейнеров, таких как ZIP-архивы, файлы почты OST/PST, электронные книги, разметки и портфолио PDF.
Посмотрите наш Cloud SDKs для .NET по адресу GitHub, если вам нужен исходный код для разбора файлов в облаке.
Вы можете попробовать GroupDocs.Parser Low-Code .NET APIs без ограничений.
Три типа контента. Текст всего файла или выбранной страницы, изображения, хранящиеся в нём, и метаданные, записанные в нём, такие как автор, название и дата создания. Шаблон добавляет в этот список именованные поля и значения таблиц.
Шаблон описывает, где находятся нужные значения на странице - по позиции, по окружающему тексту или по области таблицы. Применение его к документу с таким макетом возвращает каждое значение под заданным именем, что удобно для счетов-фактур и других повторяющихся форм.
GroupDocs.Parser Cloud API предоставляет несколько способов извлечения текста из документов. Вы можете извлекать только текст, извлекать отформатированный текст, задавая режимы извлечения, извлекать из конкретных страниц, задавая диапазон страниц. Пример ниже показывает, как извлечь текст из PDF документа с указанием диапазона страниц.
// Get AppKey and AppSID from https://dashboard.groupdocs.cloud
string MyAppKey = "";
string MyAppSid = "";
var configuration = new Configuration(MyAppSid, MyAppKey);
var apiInstance = new ParseApi(configuration);
var fileInfo = new FileInfo
{
FilePath = "directory/document.pdf"
};
var options = new TextOptions
{
FileInfo = fileInfo,
StartPageNumber = 1,
CountPagesToExtract = 2
};
var request = new TextRequest(options);
var response = apiInstance.Text(request);
// For complete examples, visit https://github.com/groupdocs-parser-cloud/groupdocs-parser-cloud-dotnet-samples