Tabla PDF a CSV
Elige un PDF basado en texto
Convierte tablas PDF sencillas basadas en texto en archivos CSV o TSV sin enviar el PDF a un servidor. El navegador agrupa los fragmentos según su posición visible, busca columnas que se repiten e intenta descartar el texto corrido. Revisa cada tabla detectada antes de descargarla: es un extractor prudente y aproximado, no una garantía de que una maquetación compleja se convierta en filas y columnas perfectas.
Cómo extraer una tabla PDF como CSV
-
1
Elige un PDF basado en texto
Selecciona un PDF de hasta 20 MiB y 150 páginas. Si el documento solo contiene imágenes escaneadas, pásalo primero por OCR.
-
2
Deja que el navegador detecte las tablas
El extractor usa las coordenadas visibles del texto, incluida la rotación y el CropBox, y busca posiciones repetidas de filas y columnas.
-
3
Revisa y elige el formato
Marca las tablas que quieres conservar y comprueba sus filas. Elige coma, punto y coma o tabulación, además del marcador UTF-8 y la protección frente a fórmulas.
-
4
Descarga cada tabla elegida
Cada tabla seleccionada se descarga localmente en su propio CSV o TSV. Las tablas no se unen entre páginas.
Qué puede deducir el detector
Un PDF no suele guardar una tabla como una cuadrícula con celdas. Guarda fragmentos de texto en coordenadas. La herramienta agrupa los que están en una misma línea visible, une fragmentos cercanos y conserva posiciones de columna que se repiten en varias filas. Puede separar varias tablas regulares de una página y rechaza el texto de una sola columna cuando el patrón está claro.
La rotación y un CropBox desplazado se incluyen al calcular las coordenadas visibles. En filas mayoritariamente de derecha a izquierda, el orden sigue la dirección indicada por la capa de texto del PDF. Aun así, las celdas combinadas, el texto repartido en varias líneas, los diseños decorativos y las direcciones mezcladas pueden exigir correcciones.
| Diseño del PDF | Resultado probable | Qué conviene revisar |
|---|---|---|
| Exportación limpia con columnas repetidas | Suele ser el mejor caso | Encabezados, decimales y celdas vacías |
| Valor ausente en una fila regular | Se añade una celda vacía en la columna inferida | Que haya quedado vacía la columna correcta |
| Celda combinada o con varias líneas | El texto puede dividirse, desplazarse o unirse | Compara la vista previa con el PDF |
| Varias tablas regulares en una página | Pueden detectarse por separado | Selecciona solo las que necesites |
| Página escaneada como imagen | No se detecta ninguna tabla | Aplica OCR primero |
Además de los límites de 20 MiB y 150 páginas, hay topes de fragmentos de texto y caracteres. Por eso, un PDF muy fragmentado puede detenerse aunque no alcance los límites principales.
CSV, TSV y seguridad en hojas de cálculo
Los archivos con coma o punto y coma usan el delimitador elegido; con tabulación se guardan como TSV. Los registros terminan en CRLF. Un campo se encierra entre comillas dobles si contiene el delimitador activo, comillas, retorno de carro o salto de línea, y las comillas internas se duplican. Son las reglas habituales descritas en RFC 4180, adaptadas al delimitador seleccionado.
La protección frente a fórmulas está activada por defecto. Si una celda empieza por =, +, - o @ tras posibles espacios, incluidas las variantes de ancho completo compatibles, la herramienta antepone un apóstrofo para que la hoja de cálculo tienda a tratarla como texto. Ese prefijo modifica el valor. Desactivar la protección conserva el texto extraído, pero abrir contenido no fiable con aspecto de fórmula puede ser peligroso. La guía de OWASP sobre inyección CSV explica por qué no hay una mitigación universal para todas las hojas de cálculo y posteriores guardados.
El marcador UTF-8 opcional ayuda a algunas aplicaciones a reconocer texto no latino. Revisa siempre el archivo antes de usarlo en contabilidad, informes o importaciones automáticas.
Estado privado entre pasos
El PDF, las tablas detectadas y tus opciones permanecen en este navegador. Se guardan en un almacenamiento local limitado durante un máximo de 30 minutos para mantener los tres pasos, y las descargas se crean localmente. La herramienta no sube nada. Empezar de nuevo elimina el trabajo actual; el navegador también puede borrar los datos antes por su política de almacenamiento o por las restricciones de la navegación privada.
Preguntas frecuentes
No. La lectura del PDF, la detección y la creación de CSV o TSV ocurren en el navegador. El trabajo actual se conserva en almacenamiento local limitado hasta 30 minutos y cada descarga es local.
No por sí solo. Un escaneo formado únicamente por imágenes no tiene una capa de texto que el extractor pueda situar. Aplica OCR y usa después el PDF basado en texto resultante.
Puedes elegir coma, punto y coma o tabulación. Los registros usan CRLF y se entrecomillan los campos que contienen el delimitador elegido, comillas, retorno de carro o salto de línea; una comilla interna se duplica. La tabulación genera un archivo .tsv.
Antepone un apóstrofo a las celdas extraídas que empiezan como una fórmula, por ejemplo con =, +, - o @ tras posibles espacios. Está activada por defecto y modifica esos valores. Desactívala solo si necesitas el texto exacto y confías en el PDF.
La detección usa posiciones repetidas del texto, no celdas reales. El texto en varias líneas, las celdas combinadas, el espaciado irregular y las direcciones mezcladas pueden desplazar valores. Aunque se normalizan la rotación y el CropBox, compara cada vista previa con el original.
Puede detectar por separado varias tablas regulares en una página. Cada tabla seleccionada se descarga en su propio archivo. No une una tabla que continúa en la página siguiente.
Herramientas relacionadas
Unir PDF
Une varios PDF en un documento, ordena archivos y páginas arrastrando y descarga el resultado al instante.
Unir PDF e imágenes
Combina PDF e imágenes JPG o PNG en un solo PDF, ordena los archivos subidos y descarga el documento desde el navegador.
Word a PDF
Convierte documentos Word .doc y .docx a PDF conservando el diseño de página, las imágenes, las tablas y los títulos. Subida segura y borrado automático tras 2 horas.
Añadir páginas en blanco a PDF
Añade de 1 a 50 páginas en blanco a un PDF existente. Elige A4, Letter, Legal, A3 o A5, vertical u horizontal, e insértalas al inicio, al final, o antes o después de un número de página.
Convertidor de PDF a Excel
Detecta tablas regulares en un PDF con texto y descarga archivos XLSX, CSV o TSV locales. Revisa cada tabla antes de exportarla. Límite: 20 MiB y 150 páginas.
Convertidor de PDF a PNG
Convierte páginas PDF en archivos PNG con texto nítido, soporte de transparencia y la resolución DPI que elijas. Ideal para documentación y miniaturas.