DOCX ファイルは ZIP コンテナであり、文書内に配置されたすべての画像は、個別の PNG、JPEG、または EMF ファイルとして内部に格納されます。文書の名前を変更して手動で解凍すれば一度は機能しますが、レポートフォルダ全体にはスケールしません。GroupDocs.Parser Cloud はその構造を直接読み取り、埋め込まれた画像(写真、ロゴ、画像として貼り付けられたチャート、スキャンページ)を返します。同じリクエストは DOC やその他 50 以上のファイル形式でも動作するため、混在アーカイブでもコードパスは一本で済みます。cURL では、クライアント ID とシークレットで認証し、JSON の小さなボディにファイル名を送信し、レスポンスから抽出された画像の一覧を取得します。ローカルに何もインストールする必要がないため、シェルスクリプトや夜間ジョブに組み込むことができます。テキストや文書メタデータは、後でプロジェクトが必要とする場合に同じ API で取得可能で、無料のオンライン抽出ツールはコード不要で単一の Word ファイルをカバーします。
GroupDocs.Parser Cloud はクラウドベースの文書解析およびデータ抽出 API です。開発者は、ソフトウェアやインフラをインストール・維持することなく、アプリケーションやワークフローに文書処理機能を統合できます。GroupDocs.Parser Cloud を使用すれば、PDF、Microsoft Word、Excel、PowerPoint など、さまざまな文書形式を扱えます。API は、テキスト、メタデータ、画像、表、さらには生ファイル内容といった構造化データを文書から抽出する豊富な機能を提供します。
GroupDocs.Parser Cloud は、DOCX、PDF、Microsoft Word(DOC、DOCX)、Excel(XLS、XLSX)、PowerPoint(PPT、PPTX)を含む幅広いドキュメント形式をサポートし、JPEG、PNG、TIFF などのさまざまな画像形式もサポートします。
はい、GroupDocs.Parser CloudはDOCXを含むさまざまなドキュメント形式からメタデータを抽出できます。メタデータには、ドキュメントのプロパティ(作成者、作成日など)、タイトル、キーワードなどの情報が含まれます。
GroupDocs.Parser Cloudを使用すると、構造化データを抽出するためのテンプレートを作成できます。テンプレートには、フィールド定義、テーブル設計、正規表現ベースのルールを含めることができ、請求書や契約書などの繰り返し使用されるドキュメントから正確にデータを抽出できます。
はい、GroupDocs.Parser CloudにはOCRが含まれており、画像に基づいてスキャンされたPDFsやDOCXドキュメントからテキストを抽出できます。API設定からOCRオプションを有効にすることで、スキャンされたコンテンツを機械可読テキストに変換できます。
GroupDocs.Parser Cloudは、APIの使用量、ストレージ要件、サポートオプションなどの要因に基づいたさまざまな価格プランを提供しています。詳細およびオプションについては、pricingをご確認ください。
GroupDocs.Parser Cloudを使用すると、テキスト、メタデータ、画像、テーブル、その他の構造化情報など、さまざまな種類のデータをドキュメントから抽出できます。また、テキスト分析を実行したり、特定のキーワードやパターンを検索したり、ドキュメントを別の形式に変換したりすることも可能です。
はい、GroupDocs.Parser Cloud は包括的なドキュメントを提供しており、API リファレンス、SDK 例、コードサンプル、およびガイドが含まれています。これにより、API を統合し、効果的に使用できるようになります。
DOCX ファイルを GroupDocs.Parser Cloud に送信し、画像抽出をリクエストしてください。サービスはサーバー上でドキュメントパッケージを読み取り、埋め込まれたすべての画像を返します。そのため、Microsoft Word のコピーや、デスクトップソフトウェアは一切必要ありません。
はい。画像抽出ツールは、古いバイナリ DOC 形式に加えて DOCX 形式、さらに PDF を含む 50 以上の形式(スプレッドシートやプレゼンテーションなど)を受け付けます。同じリクエストでそれらすべてを処理できるため、混在フォルダーに対するバッチジョブをシンプルに実行できます。
GroupDocs.Parser Cloud を使用すると、ドキュメントから画像を抽出できます。この機能により、DOCX を含むさまざまなドキュメント形式に埋め込まれた画像を取得でき、ビジュアルコンテンツにアクセスできます。
GroupDocs.Parser Cloud は、PDF、Microsoft Word(DOC、DOCX)、Excel(XLS、XLSX)、PowerPoint(PPT、PPTX)など、幅広いドキュメント形式に対応しています。また、JPEG、PNG、TIFF などのさまざまな画像形式もサポートしています。
GroupDocs.Parser Cloud は、DOCX PDF、Word ドキュメント、Excel スプレッドシート、PowerPoint プレゼンテーションなど、さまざまな文書形式からテキストを抽出できます。個々のページまたは文書全体からテキストを抽出することができます。
API は、DOCX やその他の文書から、文書プロパティ(作成者、作成日など)、タイトル、キーワード、その他文書に埋め込まれた関連情報といったメタデータを抽出できるようにします。
GroupDocs.Parser Cloud は高度なテーブル抽出機能を提供します。文書内のテーブルを検出し、構造を解析し、テーブルデータとそれに付随する書式情報を抽出できます。