markov‑ai/cad‑1000‑hours 数据集

开发机构:Markov‑AI(Markov Studios),专门面向计算机使用Agent(Computer‑use Agent),提供人类操作专业桌面软件的开源多模态数据集,不是CAD工具软件,是训练AI操作CAD软件的数据集。

一、数据集基本概况

  • 版本:CAD‑1K Open v2
  • 总时长:1018.12 小时真人Windows平台CAD完整任务录屏,共 509个端到端CAD任务,全部运行于Windows系统。
  • 总大小:207.18GiB(完整下载约222GB),Hugging‑Face月下载量超过11万次。
  • 核心定位:用于训练、评测能直接操作CAD桌面软件的AI智能体;区别于普通“文本生成CAD图纸”数据集,它记录人类完整GUI交互全过程(视频、鼠标、键盘、任务文档、源文件、输出成品、评分标准、步骤旁白),支持行为克隆、长任务规划、多模态Agent研究。

⚠️页面提示DatasetGenerationError:Hugging‑Face在线预览解析JSON出错,属于网页预览bug,数据集本身文件完整,可以正常下载使用。

二、覆盖CAD软件与任务领域

1)软件分布(7大类CAD/BIM软件)

软件 任务数量 总时长 占比
AutoCAD 312 675.40h 66.3%
Revit 24 116.76h 11.5%
SOLIDWORKS 114 100.91h 9.9%
SketchUp 30 94.70h 9.3%
CATIA V5 7 17.76h 1.7%
Siemens NX 20 10.05h 1.0%
V‑Ray 2 2.54h 0.2%

2)业务任务领域分布

  • 建筑绘图 Architectural drafting(55.6%)
  • 机械CAD Mechanical CAD(19.3%)
  • 室内设计 Interior design(10.9%)
  • BIM建模(8.9%)
  • 结构设计(4.0%)
  • 可视化、钣金设计(剩余)

3)任务时长统计

  • P25:35.3分钟;中位数P50:69分钟;P75:136.9分钟
  • 最短任务:12.2min;最长任务:812.2min;大量长时序复杂工程任务,专门针对长Horizon AI Agent训练。

三、每一个任务目录完整文件结构

每个任务文件夹路径格式:{软件名}/{task_id}/,每个任务包含全部下面文件,形成闭环的训练样本:

{software}/{task_id}/
├── task_desc.json        # 任务描述:任务要求、目标、使用软件、参考输入路径、预期交付结果
├── rubrics.json          # 任务评测打分标准(用于评测AI输出是否合格)
├── task_overview.pdf     # 任务总览PDF,整合需求、评分标准、参考图
├── clip.mp4              # 屏幕录制视频,完整人类操作录屏
├── frame_events.json     # 帧对齐交互事件:逐帧同步鼠标移动、点击、按键GUI事件
├── metadata.json         # 元信息:总时长、帧数、任务分类、平台信息
├── narration.json        # 帧级自然语言旁白,人类操作时的步骤文字解说
├── input_files/          # 任务原始参考素材:pdf、dwg、图片、skp、rvt等参考文件
│   └── input[_N].ext
└── output_files/         # 人类完成后的最终交付成品文件
    └── output[_N].ext

关键数据字段说明

  1. frame_events.json:最重要的交互标注,每一帧视频对应事件列表;记录mouse_move、鼠标按键状态、屏幕坐标px、时间戳,实现视频画面 ↔ GUI动作 精准时间对齐,表格预览中frame帧序号、video_t_ms视频毫秒时间戳、events交互事件数组即来源于此文件。
  2. narration.json:帧级自然语言解说,提供“视觉画面+操作动作+自然语言说明”多模态对齐,适合微调视觉大模型、VLM计算机使用Agent。
  3. 输入输出文件格式丰富:dwg、rvt、sldprt、skp、pdf、png/jpg等真实工程文件,不是仅图片;训练时AI不仅看视频,还能读取原始CAD工程文件做输入输出校验。

四、数据集用途

  1. 训练CAD领域Computer‑use Agent
    训练AI智能体,模仿工程师,直接打开Windows CAD软件、执行GUI点击、绘制建模,完成完整工程任务;不是只生成CAD代码,而是模仿人操作软件的完整流程。
  2. 行为克隆(Behaviour Cloning):利用视频+同步鼠标键盘事件做模仿学习。
  3. AI Agent评测基准:借助rubrics.json打分标准,量化评估Agent完成CAD任务好坏。
  4. 长时序多模态大模型研究:任务大多几十分钟甚至十几个小时,适合长上下文、复杂规划能力的模型实验。

五、局限与注意点

  1. 仅Windows平台数据:全部任务基于Windows系统,没有Mac/Linux CAD操作样本。
  2. Hugging‑Face网页预览报错DatasetGenerationError,不影响下载本地使用,是在线解析JSON的服务端错误,不是数据集损坏。
  3. 文件体积巨大,完整下载需要数百GB存储空间,网络消耗高;可以选择性下载部分软件子集(例如仅AutoCAD目录)。
  4. 为研究开源数据集,不包含商业授权,使用遵循HuggingFace数据集许可协议。
  5. 聚焦GUI交互行为,不提供CAD模型B‑Rep几何内部表示;数据重点在人类软件操作轨迹。

六、和普通CAD数据集区别

数据集类型 代表 特点
cad‑1000‑hours 本数据集 录屏+鼠标键盘事件+源/成品工程文件,学习怎么操作软件GUI
DeepCAD / ZeroToCAD1m 传统CAD数据集 CAD模型几何、建模脚本代码,学习生成CAD几何/代码

简单理解:传统数据集教会AI输出图纸结果;cad‑1000‑hours教会AI像工程师一样点开软件,一步步点鼠标画图得到图纸。

免责声明:本网站仅提供网址导航服务,对链接内容不负任何责任或担保。
相关资讯