司马阅 DocMind(DocMind-V3.0)

基础概况

主体:成都三生万物科技 · 司马阅(SmartRead)自研垂直文档智能基座
当前版本:DocMind V3.0
备案资质:国家生成式AI模型备案
备案号:510104225097201240011
定位:RAG/企业知识库上游专用文档解析引擎
≠通用对话大模型;核心作用:把杂乱文档转为结构化、可溯源、高质量数据,供给LLM使用,缓解大模型幻觉。

核心技术架构(多模型协同体系)

底层0.6B轻量多模态模型,Rust高性能推理,由4个专业子模型协同工作:

  1. 版面分析模型
    识别标题、正文、页眉页脚、多栏排版、跨页区块;还原文档天然阅读顺序,区分图文、表格边界。

  2. 增强OCR模型
    处理扫描PDF、照片文档,去倾斜、去噪;通用场景识别准确率>95%。

  3. 表格解析模型
    支持跨页表格、图片内嵌表格,输出结构化二维数据。

  4. 公式识别模型
    识别理工公式、专业符号,适合工程、技术手册场景。

支持输入格式

PDF(文字版/扫描件)、Word、PPT、Excel、图片(JPG/PNG/TIFF);
擅长:图文混排、多栏期刊、设备技术手册、图纸附带说明文档、标书、合同

标准输出

带坐标溯源的结构化JSON / Markdown,包含:
段落层级、区块类型、表格矩阵、图片关联文本、文档元数据(标题、版本、页码);
输出结果自带原文位置引用,实现AI回答溯源(非常适合工业严肃场景)。

核心价值(和通用OCR/开源解析最大区别)

  1. 解决RAG最大痛点:劣质切片带来的AI幻觉
    普通工具粗暴按字符切割,破坏上下文;DocMind按语义区块切割,保留版面逻辑。

  2. 轻量化,私有化部署门槛低
    0.6B参数,不需要超高配GPU;支持单机本地部署、容器化,适合企业内网涉密资料(制造业技术文档、外贸资料)。

  3. 文档元素关联理解
    自动关联:图纸 ↔ 图注、表格 ↔ 正文描述、公式 ↔ 上下文说明。

部署方式

  1. 私有化本地部署(主推)
    内网离线运行,文档不出服务器;适配信创、制造业保密要求;可对接自有向量库(Milvus、Chroma、PGVector)+任意LLM(DeepSeek、Qwen、Llama等)

  2. API云服务(SaaS)
    公有云在线调用,适合中小体量测试;

  3. 内嵌至司马诸葛平台
    司马阅自研一体化AI智能体平台:DocMind(解析) + LLM 成套企业知识库系统。

免责声明:本网站仅提供网址导航服务,对链接内容不负任何责任或担保。
相关资讯