.NET 用の Document Data Extraction SDK: テキスト、画像

GroupDocs.Parser Cloud は、.NET プロジェクトに対し、保存されたドキュメントの内容を読み取る手段を提供します。呼び出しでファイル名と取得したいコンテンツの種類を指定すると、ページのテキスト、埋め込まれた画像、またはファイルに記録されたメタデータフィールドが返されます。

テンプレートはレイアウトが共通するドキュメントを扱います。フィールド位置やテーブル領域を一度だけ定義し、あらゆる請求書、領収書、フォームなどに適用できるため、値は構造化された名前付き結果として取得でき、解釈が必要な非構造化テキストを避けられます。

50 以上のフォーマットに対応しており、PDF、Word、Excel、PowerPoint、メールメッセージ、電子書籍、アーカイブ、ウェブページなどが含まれます。解析はサーバー側で実行されるため、呼び出し元のマシンに SDK パッケージ以外のものをインストールする必要はありません。

配布は NuGet を通じて行われ、すべてのリクエストにはアカウントの Client ID と Secret が含まれます。評価は無料トライアル内で実行できます。SDK のソースコードと実行可能サンプルは、採用前に呼び出し内容を確認したい開発者向けに GitHub に公開されています。

  • cURL用GroupDocs.Parser Cloud
  • Java用GroupDocs.Parser CloudSDK
  • PHP用GroupDocs.Parser CloudSDK
  • GroupDocs.Parser Cloud SDK(Python 向け)
  • GroupDocs.Parser Cloud SDK(Ruby 向け)
  • GroupDocs.Parser Cloud SDK(Node.js向け)
無料トライアルを開始

GroupDocs.Parser Cloud SDK は、.NET ベースのアプリケーション内で、テキストや画像、メタデータを抽出するために、あらゆる文書を解析できるように .NET の開発者を支援します。SDK(REST API クライアント)は、開発者が開発を迅速に進めるための最も簡単かつ迅速な手段です。これにより、開発者はプロジェクト固有のコードを書くことに専念でき、リクエストの作成やレスポンスの処理といった低レベルの詳細を気にする必要がなくなります。文書は、データフィールド定義やテーブル定義を含む、使いやすいユーザー定義テンプレートによって解析できます。これにより、標準的な文書だけでなく、ZIP アーカイブや OST/PST メールデータファイル、eBook、マークアップ、PDF ポートフォリオといったコンテナからも、テキストフィールドや数値、テーブルなどのデータを簡単に抽出できます。

よくある質問

独自の.NETアプリケーションを作成して、オンラインでファイルを解析したいです。

クラウドでファイルを解析するためのソースコードをお探しの場合は、Cloud SDKsで.NETをご確認ください(GitHub)。

.NET上でGroupDocs.Parser REST APIsを無料で試すことはできますか?

制限なく Low-Code の .NET APIs をGroupDocs.Parser(https://purchase.groupdocs.cloud/trial)試すことができます。

.NET SDK は文書から何を抽出できますか?

3種類のコンテンツがあります。ファイル全体または選択したページのテキスト、内部に保存された画像、そして作者、タイトル、作成日などのメタデータです。テンプレートを使用すると、名前付きフィールドやテーブルの値をそのリストに追加できます。

テンプレートベースのパースはどのように機能しますか?

テンプレートは、ページ上で目的の値が位置や周囲のテキスト、テーブル領域のどこにあるかを記述します。そのレイアウトの文書に対して実行すると、各値が名前で返されます。これにより、請求書やその他の繰り返し形式のフォームに適しています。

Document Parser REST API の機能

PDF、ワード文書、スプレッドシート、プレゼンテーションを解析できます

Microsoft Word、Excel、PowerPoint、OpenDocument テンプレートファイルを解析できます

MS Word, Excel, PowerPoint 用のマクロ対応ドキュメントおよびテンプレートを解析できます

文書全体からテキストコンテンツを抽出できます

特定のページからテキストと画像を抽出できます

抽出モードを設定して、書式付きテキストを抽出できます

ZIP アーカイブやメール内のドキュメントからテキストを抽出できます

メール、PDF ポートフォリオ、MS Outlook ストレージからドキュメントを取得できます

ドキュメントのページ数やその他の情報を取得できます

ページ番号範囲で文書からテキストを抽出

GroupDocs.Parser Cloud API は、文書からテキストを抽出する複数の方法を提供します。テキストのみを抽出したり、抽出モードを設定して書式付きテキストを抽出したり、ページ範囲を設定して特定のページから抽出したりできます。以下の例は、ページ範囲を設定して PDF 文書からテキストを抽出する方法を示しています。

特定のページからテキストを抽出するために PDF 文書を解析します - C# .NET

// Get AppKey and AppSID from https://dashboard.groupdocs.cloud
  string MyAppKey = "";
  string MyAppSid = "";

  var configuration = new Configuration(MyAppSid, MyAppKey);

  var apiInstance = new ParseApi(configuration);
  var fileInfo = new FileInfo
  {
  FilePath = "directory/document.pdf"
  };

  var options = new TextOptions
  {
  FileInfo = fileInfo,
  StartPageNumber = 1,
  CountPagesToExtract = 2
  };

  var request = new TextRequest(options);
  var response = apiInstance.Text(request);

  // For complete examples, visit https://github.com/groupdocs-parser-cloud/groupdocs-parser-cloud-dotnet-samples

GroupDocs.Parser 無料アプリを使用してドキュメントから画像を抽出する

GroupDocs.Parser 無料アプリを使用してドキュメントから画像を抽出する

サポートと学習リソース

GroupDocs.Parser Cloud は、以下に示す他の言語向けに個別文書解析 SDKs も提供します:

  日本語
84ca13577