PixelRAG 简介

PixelRAG 是 UC Berkeley(加州大学伯克利分校,Sky Computing Lab / BAIR)提出并开源的纯像素空间视觉RAG(Visual Retrieval-Augmented Generation)项目,论文标题《PIXELRAG: Web Screenshots Beat Text for Retrieval-Augmented Generation》,获 MLSys 2026 最佳论文,开源协议 Apache-2.0。

核心思想:不做HTML解析、不抽文本,直接把网页/PDF渲染成截图切片(tile),全程在图像像素空间完成检索+问答,完整保留版式、表格、图表、信息框等视觉结构,解决传统文本RAG解析时丢失布局信息的痛点。

✅ 核心工作流程

  1. Render渲染切片(pixelrag-render)
    使用Playwright无头浏览器渲染网页/PDF,按固定视口高度切分成多张截图小瓦片(image tile),长文档自动分页切片,表格、图表、排版原样保留。
  2. 视觉Embedding编码
    用经过LoRA微调的 Qwen3-VL-Embedding-2B 视觉嵌入模型,把每一张截图tile转为2048维向量;向量存入FAISS向量库,构建检索索引。
  3. 检索召回
    用户提问时,把问题编码到同一向量空间,检索Top-K最相关截图瓦片。
  4. VLM读图生成答案
    召回的截图直接送入多模态视觉大模型(VLM,如Claude等),模型直接读取像素画面回答问题,中间不转文本/OCR

📊 关键亮点与实测效果

  1. 性能提升:在SimpleQA等基准上,对比传统文本RAG,准确率最高提升约18%;哪怕纯文本类问答任务,看图检索也优于文本切块检索。
  2. 超大预置索引:预构建完整维基百科索引,覆盖828万维基页面、合计约3000万截图瓦片,可以直接加载使用,无需自己爬取渲染维基。
  3. 适用内容:网页、PDF、扫描文档、带复杂表格/流程图/信息图的材料;特别适合传统文本RAG容易崩坏的结构化版式内容
  4. 生态:GitHub仓库 StarTrail-org/PixelRAG,官网 pixelrag.ai;附带Claude Code插件(pixelbrowse),可直接在Claude Code中调用像素浏览检索能力。

⚠️ 局限

  1. 资源开销更大:渲染截图、图像向量、存储索引的算力/显存高于普通文本RAG;全量维基原始截图5.6TB,向量索引约120GB。线上可按需渲染,不持久保存原图来降低存储压力。
  2. 纯文本场景性价比一般:如果文档只是纯文字、没有表格图表,传统文本RAG速度更快、成本更低。
  3. 依赖VLM能力:最终问答质量受后端视觉大模型读图能力限制。

🧩 典型使用场景

  • 网页/技术文档里的复杂表格、工程图纸、信息框、流程图问答
  • PDF报告、年报、合同、扫描文档,保留版式理解
  • AI Agent网页浏览(代替网页文本抓取,让Agent像人一样看页面)
免责声明:本网站仅提供网址导航服务,对链接内容不负任何责任或担保。
相关资讯