Extracción de datos de documentos SDK para .NET: Texto, Imágenes

GroupDocs.Parser Cloud le brinda a un proyecto .NET una forma de leer lo que hay dentro de un documento almacenado. Una llamada especifica el archivo y el tipo de contenido que deseas, y la respuesta devuelve el texto de las páginas, las imágenes incrustadas en ellas o los campos de metadatos registrados en el archivo.

Las plantillas gestionan documentos que comparten un mismo diseño. Las posiciones de los campos y las áreas de tablas se describen una sola vez y luego se aplican a cada factura, recibo o formulario de ese tipo, de modo que los valores llegan como resultados nombrados en lugar de texto sin estructurar que aún debe interpretarse.

Se admiten más de 50 formatos, entre ellos PDF, Word, Excel, PowerPoint, mensajes de correo electrónico, libros electrónicos, archivos y páginas web. El análisis se ejecuta en el servidor, por lo que no es necesario que nada más que el paquete SDK esté presente en la máquina que realiza la llamada.

La distribución se realiza a través de NuGet, y cada solicitud lleva el ID de cliente de la cuenta con su secreto. La evaluación se ejecuta dentro de la prueba gratuita. El código fuente de SDK y los ejemplos ejecutables se publican en GitHub para los desarrolladores que prefieren leer las llamadas antes de adoptarlas.

  • GroupDocs.Parser Cloud para cURL
  • GroupDocs.Parser Cloud SDK para Java
  • GroupDocs.Parser Cloud SDK para PHP
  • GroupDocs.Parser Cloud SDK para Python
  • GroupDocs.Parser Cloud SDK para Ruby
  • GroupDocs.Parser Cloud SDK para Node.js
Empiza la prueba gratuita

GroupDocs.Parser Cloud SDK facilita a los desarrolladores de .NET analizar cualquier documento para extraer texto, imágenes y metadatos dentro de aplicaciones basadas en .NET. SDK (Cliente REST API) es la forma más fácil y rápida para que el desarrollador acelere el desarrollo. Esto permite al desarrollador centrarse únicamente en escribir el código específico del proyecto y no preocuparse por los detalles de bajo nivel de realizar solicitudes y manejar las respuestas. Los documentos pueden analizarse mediante plantillas definidas por el usuario, fáciles de usar, con definiciones de campos de datos y de tablas. Luego es sencillo extraer datos como campos de texto, números, tablas de los documentos típicos e incluso de contenedores como archivos ZIP, archivos de datos de correo OST/PST, eBooks, marcas y portafolios PDF.

Preguntas frecuentes

Quiero crear mi propia aplicación .NET que pueda analizar archivos en línea?

Consulta nuestro Cloud SDKs para .NET en GitHub si buscas el código fuente para analizar archivos en la nube.

¿Puedo probar GroupDocs.Parser REST APIs en .NET de forma gratuita?

Puedes probar GroupDocs.Parser Low-Code .NET APIs sin ninguna limitación.

¿Qué puede extraer el .NET SDK de un documento?

Tres tipos de contenido. El texto de todo el archivo o de una página elegida, las imágenes almacenadas dentro de él, y los metadatos registrados, como autor, título y fecha de creación. Una plantilla añade campos con nombre y valores de tabla a esa lista.

¿Cómo funciona el análisis basado en plantillas?

Una plantilla describe dónde se encuentran los valores deseados en la página, por posición, por texto circundante o por región de tabla. Ejecutarla contra un documento con ese diseño devuelve cada valor bajo el nombre asignado, lo que resulta adecuado para facturas y otros formularios repetitivos.

Características del Analizador de Documentos REST API

Analiza PDF, documentos de procesamiento de texto, hojas de cálculo y presentaciones

Analiza archivos de plantilla Microsoft Word, Excel, PowerPoint y OpenDocument

Analiza documentos y plantillas con macros habilitadas para MS Word, Excel y PowerPoint

Extrae el contenido de texto de todo el documento

Extrae texto e imágenes de páginas específicas

Extrae texto formateado configurando el modo de extracción

Extrae texto de los documentos en archivos ZIP o correos electrónicos

Recupera documentos de correos electrónicos, carteras PDF y almacenes MS Outlook

Obtén el número de páginas del documento y otra información

Extraer texto de un documento por un rango de páginas

GroupDocs.Parser Cloud API ofrece varias formas de extraer texto de los documentos. Puedes extraer solo texto, extraer texto con formato configurando los modos de extracción y extraer texto de páginas específicas estableciendo un rango de páginas. El siguiente ejemplo muestra cómo extraer texto de un documento PDF estableciendo un rango de páginas.

Analiza el documento PDF para extraer texto de páginas específicas - C# .NET

// Get AppKey and AppSID from https://dashboard.groupdocs.cloud
  string MyAppKey = "";
  string MyAppSid = "";

  var configuration = new Configuration(MyAppSid, MyAppKey);

  var apiInstance = new ParseApi(configuration);
  var fileInfo = new FileInfo
  {
  FilePath = "directory/document.pdf"
  };

  var options = new TextOptions
  {
  FileInfo = fileInfo,
  StartPageNumber = 1,
  CountPagesToExtract = 2
  };

  var request = new TextRequest(options);
  var response = apiInstance.Text(request);

  // For complete examples, visit https://github.com/groupdocs-parser-cloud/groupdocs-parser-cloud-dotnet-samples

Extraiga imágenes de documentos usando la aplicación gratuita GroupDocs.Parser

Extraiga imágenes de documentos usando la aplicación gratuita GroupDocs.Parser

Recursos de apoyo y aprendizaje

GroupDocs.Parser Cloud también ofrece análisis individual de documentos SDKs para otros idiomas, como se enumeran a continuación:

  Español
b8fc1c853