2024 年《人工智能指数报告》是我们迄今为止最全面的一份,并且是在人工智能对社会的影响空前显著的重要时刻发布。今年,我们扩大了范围,更广泛地涵盖了一些关键趋势,如人工智能的技术进步、公众对该技术的看法以及围绕其发展的地缘政治动态。本版包含了比以往任何时候都多的原始数据,引入了对人工智能训练成本的新估计、对负责任的人工智能领域的详细分析,以及一个全新的章节,专门探讨人工智能对科学和医学的影响。

1.人工智能在某些任务上击败了人类,但不是在所有任务上。
人工智能已经在几个基准上超越了人类的表现,包括一些图像分类、视觉推理和英语理解。但它在更复杂的任务上落后,如竞赛级数学、视觉常识推理和规划。
2.工业界继续主导前沿人工智能研究。
2023年,工业界产生了51个著名的机器学习模型,而学术界只贡献了15个。2023年,产业界和学术界合作产生了21个值得注意的模型,创下新高。
3.前沿模型变得更加昂贵。
根据人工智能指数的估计,最先进的人工智能模型的训练成本已经达到了前所未有的水平。例如,OpenAI的GPT-4使用了价值约7800万美元的计算来训练,而谷歌的双子座超成本为1.91亿美元。
4.美国领先中国、欧盟和英国成为顶级人工智能模型的主要来源。
2023年,61个著名的人工智能模型来自美国机构,远远超过欧盟的21个和中国的15个。
5. 缺乏负责任AI的标准化基准报告
AI工具的基准效果很大程度上依赖于其标准化的方法和应用。然而,人工智能指数的研究显示,负责任AI的报告标准化程度严重不足。例如,OpenAI、谷歌和Anthropic等领先开发者大多用不同的负责任AI基准测试模型。这些使用不同基准的测试模型使我们更难做出比较,因为每个基准都有其特点。标准化的基准测试对提高AI能力的透明度至关重要。
6. 生成式AI的投资飙升
尽管2023年整体的AI私人投资有所下降,但对生成式AI的投资大幅增加。生成式AI领域去年吸引了252亿美元的投资,几乎是2022年的9倍、2019年的约30倍。2023年,生成式AI占所有AI相关私人投资的25%以上。
7.人工智能使员工更有效率,并带来更高质量的工作。****
2023年,几项研究评估了人工智能对劳动力的影响,表明人工智能使员工能够更快地完成任务,并提高他们的产出质量。这些研究还证明了人工智能弥合低技能和高技能员工之间技能差距的潜力。还有一些研究警告说,在没有适当监督的情况下使用人工智能会导致绩效下降。
8. AI越来越推动科学进步
人工智能指数指出,AI从2022年就开始推动科学发现,2023年则在推出科学相关的AI应用方面取得了更大的飞跃。例如,AI驱动化学机器人Synbot可用于合成有机分子,GNoME发现了适用于机器人和半导体制造等领域的稳定晶体等。
9.美国人工智能法规数量急剧增加。
美国人工智能相关法规的数量在过去一年大幅上升。2023年,美国有25项人工智能相关法规,而2016年美国只有一项AI法规出台。仅去年一年,美国人工智能相关法规的总数就增长了56.3%。欧盟通过的AI相关的法规数量从2022年的22项增加到2023年的32项。不过,2021年欧盟批准的法规最多,达到了46项。
10.人类更加认识到AI的潜在影响——也更加紧张。
Ipsos的一项调查显示,在过去的一年里,认为人工智能将在未来三到五年内极大地影响他们生活的比例从60%上升到66%。此外,52%的人对人工智能产品和服务表示紧张,比2022年上升了13个百分点。在美国,Pew数据显示,52%的美国人表示对人工智能感到担忧而不是兴奋,高于2022年的38%。
信息来源:斯坦福大学
更多信息请见:https://aiindex.stanford.edu/report/

1 年前
SAP联合创始人、亿万富翁Hasso Plattner计划对位于波茨坦的前勃兰登堡州议会大楼进行重大投资,将其改造为波茨坦大学的第四个校区。这一举措意在将波茨坦打造为“欧洲的斯坦福”,进一步巩固其在科技、研究与创新领域的地位。 项目核心内容包括: 对年久失修、甚至在2023年曾发生火灾的前议会建筑进行修复与重建; 在该地建设新的教学和研究设施,为波茨坦大学提供更多空间; 扩展现有的Hasso Plattner研究所(HPI),加强软件工程与数字创新研究; 投资覆盖波茨坦大学的Golm、Griebnitzsee等校区。 人工智能将成为学术发展的重点 普拉特纳在一份声明中阐明了目标,即实现 “国际领先的研究与教学”,重点聚焦于人工智能(AI)。“欧洲需要这样的地方,让来自世界各地的人才能够自由思考、研究和创造 —— 波茨坦将成为这样一个地方。” 资金与影响: 虽然具体金额未公开,但预计是数十亿欧元级别。此投资对于财政压力较大的勃兰登堡州意义重大,尤其是在该州计划新举债约20亿欧元的背景下。 Plattner的地区影响力: 他曾出资重建州议会大楼外立面,创建了Barberini博物馆和Minsk艺术馆。他在波茨坦Griebnitzsee拥有住所,并通过其基金会深度参与当地教育与文化项目。基金会总部设在著名设计师Wolfgang Joop的旧别墅中。 (图片:HPI.de)

1 年前
CheXNet 是由斯坦福大学研究团队开发的一种深度学习模型,专门用于从胸部 X 光片中检测和诊断疾病。它基于卷积神经网络(CNN),最初是在 2017 年由 Pranav Rajpurkar、Jeremy Irvin 等研究人员在论文《CheXNet: Radiologist-Level Pneumonia Detection on Chest X-Rays with Deep Learning》中提出的。 CheXNet 的背景与目标 医学影像分析一直是人工智能在医疗领域的重要应用方向。胸部 X 光片是诊断多种胸部疾病(如肺炎、肺结节、心脏扩大等)的常见工具,但传统的诊断依赖放射科医生的人工判读,效率和准确性可能因医生的经验而异。CheXNet 旨在通过自动化分析达到甚至超过人类放射科医生的诊断水平,尤其是针对肺炎的检测。 技术原理 CheXNet 是基于 DenseNet-121(一种深度卷积神经网络架构)进行改进的模型。研究团队利用了 NIH(美国国立卫生研究院)发布的 ChestX-ray14 数据集,该数据集包含超过 10 万张胸部 X 光图像,标注了 14 种常见胸部疾病。CheXNet 在这个数据集上进行训练,能够同时预测这些疾病的存在与否。 具体来说: 输入:单张胸部 X 光图像。 输出:14 种疾病的概率分布(例如肺炎、肺气肿、胸腔积液等)。 创新点:通过微调 DenseNet-121 的最后一层,CheXNet 不仅能检测单一疾病,还能处理多标签分类任务(即一张图像可能同时存在多种疾病)。 在测试中,CheXNet 的表现尤其在肺炎检测上达到了放射科医生的水平,其 ROC 曲线下面积(AUC)超过了 0.76,显示出较高的敏感性和特异性。 应用与影响 CheXNet 的开发展示了 AI 在医学影像诊断中的潜力,尤其是在资源匮乏地区,自动化的工具可以辅助医生快速筛选和诊断。它也推动了后续研究,比如结合注意力机制、可解释性分析(如热力图,显示模型关注图像的哪些区域)以及与其他数据集的迁移学习。 局限性 尽管 CheXNet 表现优异,但它仍有局限性: 数据依赖性:模型的效果依赖于训练数据的质量和多样性,可能在不同人群或设备生成的 X 光片上表现不一致。 可解释性:作为深度学习模型,它的决策过程对人类来说仍是“黑箱”,需要进一步改进以获得医生的信任。 临床验证:虽然在研究中表现良好,但在真实临床环境中的广泛应用还需要更多验证。 后续发展 CheXNet 开辟了医学影像 AI 研究的新方向。斯坦福团队和其他研究者在此基础上开发了更先进的模型(如 CheXNeXt),并探索了与自然语言处理结合的系统,用于生成放射学报告。xAI 等公司也在类似领域推进研究,试图将 AI 更深入地融入医疗实践。

1 年前
德国人工智能研究的高校重镇 德国作为工业强国,在人工智能领域也具有深厚的底蕴和领先地位。众多德国高校在AI研究方面投入了大量资源,取得了丰硕成果。

8 天前
西门子Xcelerator开放式数字商业平台作为正式发布生态合作伙伴"繁星计划",旨在发挥平台网络效应,与生态伙伴共享知识与技术资源,共创面向客户的解决方案,共赢数字化与低碳化新机遇。

14 天前
AI 研发已从单点 Prompt 优化迭代至Harness 工程底座 + Loop 自治闭环 + SDD 标准化规范的三位一体体系,通过重构人机协作模式,解决大模型落地不稳定、难规模化的痛点,实现企业级 AI 从原型试用走向工程化、自动化、体系化落地。

18 天前
WorkBuddy有望拿下国内独立桌面自动化办公智能体细分第一。但受企业协同生态、移动端能力等短板限制,无法成为全域企业及全球办公AI赛道第一名,将与钉钉悟空、WPS AI形成差异化竞争格局。

26 天前
OpenClaw工具与生态完整生命周期判断 本文尝试分短期、中期、长期三段,结合项目现状、风险、护城河客观测算OpenClaw这款智能体工具或者相似工具的发展趋势。 一、短期生命力(1~3年,2026–2029):完全安全、高速增长,是黄金运营窗口期 支撑理由 赛道刚需独一无二,差异化壁垒极强 OpenClaw是极少数本地系统级执行、模型无关、纯自托管的终端Agent运行框架,定位“能操作电脑文件、软件、桌面的AI助手”,区别于LangGraph/CrewAI这类后端开发框架、AutoGPT纯实验型智能体。普通办公、个人自动化、小微企业没有替代同类成熟开源工具,C端+中小企业需求持续释放。 社区与生态飞轮已经跑通 GitHub 30万+星标、近千名全球持续贡献者,日均数百条PR/Issue迭代,更新频率行业第一;创始人Peter全职维护,大厂(英伟达、Kimi、MiniMax)主动适配接入; ClawHub官方技能仓库沉淀数千标准化Skill,国内衍生生态(xia345、各类中文技能站、私有化二次改版)持续扩容,形成标准锁定; MIT宽松开源协议,允许企业二次改造、搭建托管服务,大量服务商入局完善配套生态(部署、安全加固、私有化定制)。 行业周期红利:本地终端Agent处于普及早期 2026被行业定义为桌面Agent落地元年,云端大模型成本持续下行、本地Ollama离线模型普及,完美匹配OpenClaw“本地优先”架构;未来3年,个人自动化、企业内网办公自动化需求只会扩张。 短期仅有的可控风险 Token调用成本偏高、频繁更新易出现版本兼容bug、本地高权限带来安全隐患; 以上问题官方正在持续迭代修复,企业级备份、权限沙箱、日志审计功能已逐步补齐,属于可优化痛点,不会动摇存续根基。 结论:未来1–3年是生态最繁荣、流量最大、变现最顺畅的阶段。 二、中期生命力(3~7年,2029–2033):稳定存续,但竞争加剧、增速放缓 存续核心逻辑 标准化生态具备长期锁定效应 SKILL.md、ClawHub统一技能规范、openclaw CLI命令行已经形成行业事实标准。就算出现竞品,开发者、存量数万套技能、企业定制项目迁移成本极高,生态不会短时间崩塌,会维持稳定使用人群。 分层商业模式支撑项目持续维护 原生项目开源免费,但周边商业化闭环成型:企业私有化部署服务、安全审计、托管云服务、垂直行业技能付费、模型渠道分销,持续产生现金流反哺社区开发,不会出现“没人维护停更”的局面。 使用人群分层留存 C端极客、办公自动化爱好者会长期使用; 中小企业内网自动化、数据处理场景高度依赖本地执行Agent,大厂SaaS Agent无法满足内网隐私需求; 开发者持续基于OpenClaw做二次分支、私有化改版,衍生生态会持续分流、延续整个“龙虾生态”的热度。 中期衰减变量(会降低增速,但不会淘汰项目) 微软、苹果、国产操作系统推出原生系统级AI助手,抢占普通小白用户; 新轻量化终端Agent开源框架分流开发者; 各国监管对本地高权限AI自动化工具出台更严格合规要求,提高企业落地门槛; 结论:3–7年不会消亡,但行业从爆发期进入存量竞争,流量红利收窄,平台需要深耕私有化、企业定制、垂直细分赛道才能持续盈利。 三、长期生命力(7年以上,2033之后):分两种极端走向 走向1:长期持续存活(概率60%),变成基础设施级工具 如果行业发展符合以下趋势,OpenClaw会像现在的Python、Git一样长期存续: 终端自主Agent成为电脑标配生产力工具,本地执行、离线隐私是永久刚需; OpenClaw持续完成企业级、合规化改造,成为政企内网自动化标准选型; 社区形成基金会/商业公司承接维护,摆脱单一创始人依赖,实现长久开源运营。 走向2:逐步边缘化、被新一代架构替代(概率40%) 触发条件: 操作系统底层内置标准化Agent执行层,统一API,第三方独立运行框架失去生存空间; 多模态、具身智能技术迭代,全新架构完全替代“技能+本地脚本执行”模式; 全球监管全面限制本地高权限自主AI工具,商用落地基本锁死,仅小众极客圈子留存。 即便被边缘化,存量存量技能、配套站点、私有部署项目仍会维持5–10年长尾生命周期,不会瞬间彻底消失。 四、关键风险:会大幅缩短生命周期的致命隐患 安全重大事故 若出现大规模Skill供应链投毒、批量本地数据泄露事件,企业端市场会快速萎缩,仅保留个人玩家生态;官方正在完善自动病毒扫描、技能审核机制,风险持续降低。 创始人断更、无承接主体 当前项目由Peter单人主导,若后续精力转移、无商业公司接手维护,迭代速度断崖式下滑,竞争力快速落后竞品;目前已有多家AI服务商、模型厂商深度合作,存在接手预期。 算力成本长期居高不下 如果大模型API按量价格无法大幅下降,普通用户长期使用成本过高,会劝退大众用户,仅留存企业付费群体。 国内政策监管收紧 国内针对本地自主自动化工具出台限制,国内衍生生态、配套导航平台流量大幅下滑,但海外生态不受影响。 五、综合最终总结 0–3年(黄金期):放心投入建站、填充内容、运营变现,生态高速扩张,流量红利充足; 3–7年(平稳期):生态稳定存在,竞争变多,需要走差异化(私有化、离线、海外双语)路线维持竞争力; 7年以上(分化期):要么成为长期基础设施永续存在,要么逐步小众长尾,即便衰退也有数年缓冲时间; 整体安全底线:至少拥有5年以上稳定商业运营周期,足够覆盖站点开发、回本、盈利完整周期;中长期只要避开通用综合赛道,主打本地离线私有化细分,生命周期会进一步拉长。

2 个月前
马斯克旗下 xAI 静默上线 Grok 4.3,API 价格下调约 60%,引发行业连锁降价,大模型商业化进入 “低价普惠” 阶段。