Casi todas las tuberías de RAG (Retrieval-Augmented Generation) en producción empiezan igual: un analizador convierte páginas web y documentos en texto plano para poder fragmentarlos e indexarlos. Ese primer paso, aparentemente inofensivo, suele ser el más débil de toda la cadena. Las tablas se aplanan, la maquetación se destruye y el contexto visual desaparece. Según la nueva investigación detrás de PixelRAG, esa única conversión es responsable de la mayoría de las respuestas equivocadas que producen estos sistemas.

La propuesta es radical en su simpleza: si convertir a texto es el problema, hay que dejar de convertir a texto. PixelRAG renderiza cada página como una captura de pantalla, indexa esas imágenes y entrega los fragmentos visuales recuperados directamente a un modelo de lenguaje-visión (VLM) que actúa como lector.

El parsing de HTML podría ser uno de los cuellos de botella más autoinfligidos de la búsqueda web. Si arreglar el analizador es la pregunta, quizá la respuesta sea no usar ninguno.

Diagrama del pipeline de PixelRAG: renderizar → recortar en tiles → incrustar con VLM → indexar en FAISS → leer.
[ pipeline.png ]
Diagrama del flujo de PixelRAG — disponible en el repositorio:
github.com/StarTrail-org/PixelRAG/blob/main/docs/assets/pipeline.png
Pipeline de PixelRAG: renderizar → recortar en tiles → incrustar con un VLM → indexar en FAISS → leer la imagen recuperada. Crédito: repositorio StarTrail-org/PixelRAG.

01 La idea: tratar la web como la tratamos los humanos

Cuando una persona busca un dato en una página, no la convierte mentalmente a texto plano: la mira. Ve la tabla, la cabecera, la posición de cada cifra. PixelRAG imita ese comportamiento. En lugar de extraer cadenas de texto, captura la página tal como se ve y deja que un modelo de visión la interprete.

Dos piezas hacen que esto funcione. La primera es el propio cambio de formato: documentos a imágenes en vez de documentos a texto, lo que preserva diseño, estructura y tablas. La segunda es un modelo de incrustación basado en Qwen3-VL-Embedding, afinado con LoRA sobre datos de capturas de pantalla, capaz de convertir imágenes de páginas en vectores que se pueden buscar. El equipo descubrió que un VLM, tras un preentrenamiento continuado sobre capturas web, se convierte en un recuperador visual sorprendentemente fuerte.

Lo más contraintuitivo es que la ventaja no se limita a contenido visual. PixelRAG supera al RAG de texto incluso en preguntas que podrían responderse solo con texto, porque la conversión a HTML descarta señales útiles —maquetación, orden, jerarquía— que el modelo visual sí conserva.

02 Los números

Los investigadores probaron PixelRAG en seis benchmarks que abarcan preguntas factuales sobre Wikipedia, consultas basadas en tablas, preguntas multimodales y recuperación de noticias en vivo. Ganó en los seis, incluso en las tareas resolubles únicamente con texto.

En SimpleQA alcanzó un 78,8% de precisión frente al 71,6% del mejor analizador de texto. La brecha se ensancha en consultas sobre tablas estructuradas: 48,8% frente a 42,5%. La mejora máxima sobre las líneas base de texto llegó a +18,1%. Todo esto se midió sobre un índice de 30 millones de tiles de capturas que cubren la totalidad de Wikipedia.

El equipo también reporta que PixelRAG logra mayor precisión que Google Search manteniendo un costo de 2 a 4 veces menor.

03 El argumento económico para los agentes

Más allá de la precisión, el caso de uso más fuerte a corto plazo es el costo en agentes de IA. En las pruebas, un agente que usó PixelRAG como motor de búsqueda consumió 3,6 millones de tokens de entrada, frente a los 37,5 millones de la recuperación basada en texto: alrededor de 10 veces menos. La razón es directa: una imagen recuperada le da al modelo lo justo que necesita, en vez de inundar el contexto con largos volcados de texto.

Y aún hay margen: la compresión de imágenes puede recortar ese presupuesto de tokens en aproximadamente un tercio adicional. Para equipos que pagan por token, esa diferencia se traduce directamente en facturas más predecibles y más bajas.

04 La letra pequeña

La técnica no es gratis. Para ver el beneficio, los equipos necesitan modelos de la clase Qwen3-VL-4B o superior. Por debajo de ese umbral, los modelos más pequeños quedan por detrás de la recuperación de texto por más de 12,5 puntos porcentuales. Dicho de otro modo: PixelRAG paga dividendos cuando el lector tiene suficiente capacidad visual; con modelos diminutos, el enfoque clásico de texto sigue ganando.

Hay además un costo de infraestructura implícito —renderizar, almacenar y servir índices de imágenes a gran escala no es trivial— que cada equipo deberá sopesar contra el ahorro en tokens de inferencia.

05 Cómo funciona por dentro

El repositorio describe a PixelRAG como un framework de recuperación visual de propósito general para construir buscadores a partir de cualquier tipo de documento —páginas web, PDF o imágenes—. Wikipedia y sus 8,28 millones de artículos son el banco de pruebas principal, pero el diseño es agnóstico al contenido. La arquitectura se reparte en cinco paquetes instalables de forma independiente:

PaqueteQué hace
renderConvierte el documento en tiles de imagen mediante Playwright/CDP y PDF.
embedTransforma los tiles en vectores y construye el índice FAISS.
indexOrquesta toda la tubería: fuente → ingesta → incrustación → índice.
serveExpone la API de búsqueda sobre FAISS (FastAPI, en CPU o GPU).
trainAfinado LoRA del modelo Qwen3-VL-Embedding para recuperación web.

Los adaptadores ya entrenados se publican en Hugging Face, de modo que no es necesario reentrenar para usar el modelo; el equipo también liberó todo el conjunto de datos de entrenamiento para que cualquiera pueda adaptar otros backbones de incrustación. El proyecto se distribuye bajo licencia Apache-2.0.

Probarlo en minutos

Buscar sobre un índice de Wikipedia ya construido es cuestión de instalar el paquete de servicio, descargar el índice y lanzar la API:

# Instalar el servicio de búsqueda
uv sync --package pixelrag-serve

# Lanzar la API
pixelrag-serve --index-dir ./index --port 30001

# Consultar
curl -X POST http://localhost:30001/search \
  -H "Content-Type: application/json" \
  -d '{"queries": [{"text": "¿Cuál es la capital de Francia?"}], "n_docs": 5}'

Construir un índice propio a partir de documentos locales solo requiere un archivo pixelrag.yaml que apunte a la fuente y al modelo de incrustación, y luego ejecutar pixelrag-index build.

06 Un plugin para darle ojos a Claude Code

Uno de los detalles más prácticos del repositorio es un plugin para Claude Code que no necesita servidor MCP ni backend: enseña al asistente a llamar a pixelrag-render directamente desde Bash y a leer las imágenes resultantes. En la práctica, basta con pedirle que mire una página:

claude --plugin-dir ./plugin -p \
  "toma una captura de https://news.ycombinator.com y resume las noticias principales"

El mismo enfoque sirve para leer un artículo de investigación de forma visual o para revisar si una web propia se ve correctamente, sin pasar por ningún analizador de texto.

07 Quiénes están detrás

El trabajo reúne a investigadores de UC Berkeley, Princeton, EPFL y Databricks. Entre sus contribuyentes figuran Yichuan Wang, Zirui Wang y Matei Zaharia, director de tecnología de Databricks y co-creador de Apache Spark. El código está abierto en GitHub y el artículo correspondiente se publicó en arXiv con el identificador 2506.05209.

Más allá de los números concretos, la tesis de fondo es la que conviene retener: durante años hemos dado por sentado que el primer paso de un sistema RAG debía ser convertir todo a texto. PixelRAG cuestiona esa premisa y sugiere que, a veces, la forma más eficiente de que una máquina entienda una página es la misma que usamos las personas: mirarla.