> ## Documentation Index
> Fetch the complete documentation index at: https://veniceai-mintlify-de47a659.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# Procesamiento de documentos

> Extrae texto y recuentos de tokens de archivos PDF, DOCX, PPTX, XLSX y texto plano de hasta 25 MB con la API Text Parser de Venice, sin inferencia.

La API Text Parser extrae texto de un documento sin ejecutar inferencia del modelo. Úsala cuando tu aplicación necesite inspeccionar, almacenar, indexar o reutilizar el contenido de un documento antes de enviarlo a un modelo.

Los formatos de entrada compatibles incluyen archivos PDF, DOCX, PPTX, XLSX y de texto sin formato de hasta 25 MB.

## Analiza un documento

Sube el archivo como `multipart/form-data`:

```bash theme={null}
curl https://api.venice.ai/api/v1/augment/text-parser \
  -H "Authorization: Bearer $VENICE_API_KEY" \
  -F "file=@document.pdf" \
  -F "response_format=json"
```

El formato de respuesta predeterminado `json` devuelve el texto extraído y su recuento de tokens. Usa `response_format=text` cuando solo necesites el texto extraído.

## ¿Text Parser o entrada de archivo en el chat?

Ambas funciones extraen el contenido del documento, pero sirven para flujos de trabajo distintos:

| Necesidad                                                 | Usa                                                           |
| --------------------------------------------------------- | ------------------------------------------------------------- |
| Preguntar a un modelo sobre un documento de inmediato     | [Entrada de archivo en el chat](/guides/features/file-inputs) |
| Extraer texto sin inferencia                              | Text Parser                                                   |
| Verificar el recuento de tokens antes de elegir un modelo | Text Parser                                                   |
| Almacenar, indexar o reutilizar el contenido extraído     | Text Parser                                                   |
| Usar el mismo documento en varios prompts                 | Text Parser                                                   |

## Flujo típico

<Steps>
  <Step title="Analiza el archivo">
    Sube el documento fuente y solicita una respuesta JSON.
  </Step>

  <Step title="Inspecciona la salida">
    Compara el recuento de tokens con la ventana de contexto del modelo de destino. Recorta o divide los documentos grandes antes de la inferencia.
  </Step>

  <Step title="Utiliza el texto">
    Agrégalo a un prompt de chat, genera embeddings para recuperación o guárdalo en tu propio almacén de datos.
  </Step>
</Steps>

<Info>
  El análisis se ejecuta en memoria sin retención de datos. Venice procesa el documento subido y lo descarta de inmediato, sin almacenar ni registrar su contenido.
</Info>

<Warning>
  La API Text Parser es experimental. El formato de sus solicitudes y respuestas puede cambiar sin previo aviso.
</Warning>

## Convierte el texto en registros

El texto extraído es un punto de partida, no un resultado. [Extracción de datos estructurados de documentos](/guides/tools/document-extraction) continúa desde aquí: fija la salida a un esquema JSON para que cada documento produzca los mismos campos, y cambia a un modelo de visión cuando el analizador informa que un archivo no tiene texto que extraer.

## Recursos relacionados

* [Extracción de datos estructurados de documentos](/guides/tools/document-extraction)
* [Referencia de la API Text Parser](/api-reference/endpoint/augment/text-parser)
* [Entradas de archivo](/guides/features/file-inputs)
* [Embeddings](/guides/features/embeddings)
* [Modelos de texto](/models/text)
