Extraction de données de documents SDK pour .NET : texte, images

GroupDocs.Parser Cloud offre à un projet .NET un moyen de lire le contenu d’un document stocké. Un appel indique le fichier et le type de contenu souhaité, et la réponse renvoie le texte des pages, les images qui y sont intégrées ou les champs de métadonnées associés au fichier.

Les modèles gèrent les documents qui partagent une même mise en page. Les positions des champs et les zones de tableau sont décrites une fois, puis appliquées à chaque facture, reçu ou formulaire de ce type, de sorte que les valeurs arrivent sous forme de résultats nommés plutôt que sous forme de texte non structuré qui doit encore être interprété.

Plus de 50 formats sont pris en charge, parmi lesquels PDF, Word, Excel, PowerPoint, les messages électroniques, les livres numériques, les archives et les pages Web. L’analyse s’effectue sur le serveur, ainsi aucun élément autre que le package SDK n’a besoin d’être présent sur la machine qui effectue l’appel.

La distribution se fait via NuGet, et chaque requête transporte l’ID client du compte avec son secret. L’évaluation se déroule dans le cadre de l’essai gratuit. Le code source SDK et les exemples exécutables sont publiés sur GitHub pour les développeurs qui préfèrent lire les appels avant de les adopter.

  • GroupDocs.Parser Cloud pour cURL
  • GroupDocs.Parser Cloud SDK pour Java
  • GroupDocs.Parser Cloud SDK pour PHP
  • GroupDocs.Parser Cloud SDK pour Python
  • GroupDocs.Parser Cloud SDK pour Ruby
  • GroupDocs.Parser Cloud SDK pour Node.js
Commencer l'essai gratuit

GroupDocs.Parser Cloud SDK facilite les développeurs .NET à analyser n’importe quel document pour extraire du texte, des images et des métadonnées au sein d’applications basées sur .NET. SDK (REST API Client) est la solution la plus simple et rapide pour le développeur afin d’accélérer le développement. Cela permet au développeur de se concentrer uniquement sur l’écriture du code spécifique au projet, sans se soucier des détails de bas niveau liés à l’émission des requêtes et au traitement des réponses. Les documents peuvent être analysés à l’aide de modèles définis par l’utilisateur, faciles à utiliser, avec des définitions de champs de données et de tables. Il devient alors simple d’extraire des données telles que des champs de texte, des nombres, des tableaux, à partir des documents classiques, voire depuis des conteneurs comme les archives ZIP, les fichiers de données mail OST/PST, les eBooks, les balisages, et les portefeuilles PDF.

Foire aux questions

Je souhaite créer ma propre application .NET capable d’analyser des fichiers en ligne ?

Consultez notre Cloud SDKs pour .NET sur GitHub si vous recherchez le code source permettant d’analyser des fichiers dans le Cloud.

Puis-je essayer GroupDocs.Parser REST APIs sur .NET gratuitement ?

Vous pouvez essayer GroupDocs.Parser Low-Code .NET APIs sans aucune limitation.

Que peut extraire le .NET SDK d’un document ?

Trois types de contenu. Le texte du fichier complet ou d’une page choisie, les images qu’il contient, et les métadonnées enregistrées telles que l’auteur, le titre et la date de création. Un modèle ajoute des champs nommés et des valeurs de tableau à cette liste.

Comment fonctionne l’analyse basée sur les modèles ?

Un modèle décrit où se trouvent les valeurs recherchées sur la page, par position, par texte environnant ou par région de tableau. L’exécuter sur un document ayant cette mise en page renvoie chaque valeur sous le nom qui lui a été attribué, ce qui convient aux factures et aux autres formulaires récurrents.

Fonctionnalités du parseur de documents REST API

Analysez PDF, les documents de traitement de texte, les feuilles de calcul et les présentations

Analysez les fichiers modèles Microsoft Word, Excel, PowerPoint et OpenDocument

Analysez les documents et modèles activés par macro pour MS Word, Excel et PowerPoint

Extrayez le contenu texte de l’ensemble du document

Extraire le texte et les images de pages spécifiques

Extraire le texte formaté en définissant le mode d’extraction

Extraire le texte des documents contenus dans des archives ZIP ou des e-mails

Récupérer les documents depuis les e-mails, les PDF portfolios et les Outlook stockages MS

Obtenir le nombre de pages du document et d’autres informations

Extraire le texte d’un document par plage de pages

GroupDocs.Parser Cloud API, propose plusieurs façons d’extraire le texte des documents. Vous pouvez extraire uniquement le texte, extraire le texte formaté en définissant les modes d’extraction, extraire depuis des pages spécifiques en définissant une plage de pages. L’exemple suivant montre comment extraire le texte d’un document PDF en définissant la plage de pages.

Analyse du document PDF pour extraire le texte de pages spécifiques - C# .NET

// Get AppKey and AppSID from https://dashboard.groupdocs.cloud
  string MyAppKey = "";
  string MyAppSid = "";

  var configuration = new Configuration(MyAppSid, MyAppKey);

  var apiInstance = new ParseApi(configuration);
  var fileInfo = new FileInfo
  {
  FilePath = "directory/document.pdf"
  };

  var options = new TextOptions
  {
  FileInfo = fileInfo,
  StartPageNumber = 1,
  CountPagesToExtract = 2
  };

  var request = new TextRequest(options);
  var response = apiInstance.Text(request);

  // For complete examples, visit https://github.com/groupdocs-parser-cloud/groupdocs-parser-cloud-dotnet-samples

Extraire des images de documents à l'aide de l'application gratuite GroupDocs.Parser

Extraire des images de documents à l'aide de l'application gratuite GroupDocs.Parser

Ressources d'assistance et d'apprentissage

GroupDocs.Parser Cloud propose également une analyse individuelle de documents SDKs pour d’autres langues, comme indiqué ci-dessous :

  Français
bb3e783b9