【AI】AI进化时间表已现!LLM每7个月能力翻倍,2030年职场不复存在?
- 2025-07-21 08:00:00


【导读】LLM正以前所未有的速度进化:METR发现,它们的智能每7个月就翻一番。到了2030年,一个模型可能只需几小时,就能搞定人类工程师几个月的工作。别眨眼,你的岗位或许已在倒计时中。
随着大模型能力一路狂飙,各路测评基准也遍地开花。
从经典的MMLU、HellaSwag,到多模态方向的MMMU、MathVista,再到AGI风格的Arena对决、Agent任务、Tool-use测试。
如何科学地衡量LLM在长时、复杂、真实世界任务中的能力,至关重要。
今年3月,METR发布重磅研究《Measuring AI Ability to Complete Long Tasks》,首次提出令人眼前一亮的新指标:
50%任务完成时间视野(50%-task-completion time horizon)
——也就是:AI能以50%成功率完成的任务,人类通常需要花多久?

论文链接:https://arxiv.org/pdf/2503.14499
据此,METR展开了一系列研究,包括任务复杂度设定、人类基准时间测量、多模型对比实验到层层统计回归建模。
最终,团队精准量化了AI智力演进速度,并抛出惊人预测:
按照目前增长速度,5年之后,大模型可能就能在一天内自动完成原本需要人类数月才能完成的复杂任务。

METR团队选出每一时间段的最强模型,建立了一个精确的「大事年表」,进一步定量分析模型能力随时间的增长情况。

结果显示出清晰的指数增长趋势:在过去的六年中,模型能力每7个月翻一番。
图中的阴影区域表示通过在任务家族、任务以及任务尝试之间进行分层自助法(hierarchical bootstrap),计算得出95%的置信区间。
不过,这个指数增长趋势非常陡峭,所以于对误差有很高的容忍度。
即便绝对测量误差达到10倍,能力到来的时间也仅会改变大约2年左右。
因此,团队对不同能力何时出现的预测基本不会出错。
METR这项研究的核心就是他们提出的这项指标:「任务完成时间视野」(task-completion time horizon)。
这个指标相当于给分别完成任务的人和AI加了个映射:
想象一组各不相同的任务,人类完成这些任务分别需要不同的时间。
把这些任务交给AI模型去做,然后找出AI能以50%成功率完成的那一档任务(但不考虑AI用的时间)。
然后对应去看人类完成这一档任务通常需要多长时间。
这个人类所需的时间,就是该模型的50%-task-completion time horizon,也即「任务完成时间视野」。

为了证明这个基准的有效性,METR团队做了翔实的统计分析。
结果显示,人类基线完成某项任务所需时间,与各模型在该任务上的平均成功率之间存在负相关关系。
简而言之,人做起来越慢,模型做起来越容易失败。
并且,用指数模型拟合这个负相关趋势效果很好。
用模型成功率对人类完成时间的对数做回归分析,算出的R²约为0.83,相关系数为0.91,这比不同模型之间平均成功率的相关系数还高。

因此,「以人类时间衡量任务难度」,这个指标非常合理。
证明了这个指标的有效性,接下来还要看看各个模型在这个指标上的表现。
团队进一步检验了不同模型能完成的任务所对应的人类耗时。
结果相当符合直觉:
2023年之前的模型(如GPT-2和GPT-3)只能完成那些只需写几句话的简单任务。
而对于人类耗时超过1分钟的任务,它们则迅速败下阵来。

相比之下,最新的前沿模型(如Claude 3.5 Sonnet和o1)则可以完成一些人类要花数小时的任务,甚至在十几小时的超长程任务上还能保持一定的成功率。


按照「7个月翻一番」的这个速度下去,METR团队得到了一个惊人结论:
到2030年,最先进的LLM有望以50%的可靠性,完成一个每周工作40小时的人类工程师花一个月才能完成的任务。
更令人毛骨悚然的是, LLM的速度可能远超人类——也许只需几天,甚至几小时。
到2030年,LLM可能已经能轻松创办一家公司、写出一部像样的小说,或是大幅改进已有的大模型。
AI研究员Zach Stein-Perlman在博客中写道,拥有此类能力的LLM的问世将带来巨大的影响,无论是潜在好处还是潜在风险」。

Kinniment承认,LLM能力翻倍的速度让人害怕,仿佛科幻片灾难前奏。
但她也表示,在现实中也可能有很多因素影响和减缓这种进展。AI再聪明,仍然可能受到硬件、机器人技术等瓶颈的掣肘。
☟☟☟
☞人工智能产业链联盟筹备组征集公告☜
☝
精选报告推荐:
11份清华大学的DeepSeek教程,全都给你打包好了,直接领取:
【清华第四版】DeepSeek+DeepResearch让科研像聊天一样简单?
【清华第七版】文科生零基础AI编程:快速提升想象力和实操能力
【清华第十一版】2025AI赋能教育:高考志愿填报工具使用指南
10份北京大学的DeepSeek教程
【北京大学第五版】Deepseek应用场景中需要关注的十个安全问题和防范措施
【北京大学第九版】AI+Agent与Agentic+AI的原理和应用洞察与未来展望
【北京大学第十版】DeepSeek在教育和学术领域的应用场景与案例(上中下合集)
8份浙江大学的DeepSeek专题系列教程
浙江大学DeepSeek专题系列一--吴飞:DeepSeek-回望AI三大主义与加强通识教育
浙江大学DeepSeek专题系列二--陈文智:Chatting or Acting-DeepSeek的突破边界与浙大先生的未来图景
浙江大学DeepSeek专题系列三--孙凌云:DeepSeek:智能时代的全面到来和人机协作的新常态
浙江大学DeepSeek专题系列四--王则可:DeepSeek模型优势:算力、成本角度解读
浙江大学DeepSeek专题系列五--陈静远:语言解码双生花:人类经验与AI算法的镜像之旅
浙江大学DeepSeek专题系列六--吴超:走向数字社会:从Deepseek到群体智慧
浙江大学DeepSeek专题系列七--朱朝阳:DeepSeek之火,可以燎原
浙江大学DeepSeek专题系列八--陈建海:DeepSeek的本地化部署与AI通识教育之未来
4份51CTO的《DeepSeek入门宝典》
51CTO:《DeepSeek入门宝典》:第1册-技术解析篇
51CTO:《DeepSeek入门宝典》:第2册-开发实战篇
51CTO:《DeepSeek入门宝典》:第3册-行业应用篇
51CTO:《DeepSeek入门宝典》:第4册-个人使用篇
5份厦门大学的DeepSeek教程
【厦门大学第一版】DeepSeek大模型概念、技术与应用实践
【厦门大学第五版】DeepSeek等大模型工具使用手册-实战篇
10份浙江大学的DeepSeek公开课第二季专题系列教程
【精选报告】浙江大学公开课第二季:《DeepSeek技术溯源及前沿探索》(附PDF下载)
【精选报告】浙江大学公开课第二季:2025从大模型、智能体到复杂AI应用系统的构建——以产业大脑为例(附PDF下载)
【精选报告】浙江大学公开课第二季:智能金融——AI驱动的金融变革(附PDF下载)
【精选报告】浙江大学公开课第二季:人工智能重塑科学与工程研究(附PDF下载)
【精选报告】浙江大学公开课第二季:生成式人工智能赋能智慧司法及相关思考(附PDF下载)
【精选报告】浙江大学公开课第二季:AI大模型如何破局传统医疗(附PDF下载)
【精选报告】浙江大学公开课第二季:2025年大模型:从单词接龙到行业落地报告(附PDF下载)
【精选报告】浙江大学公开课第二季:2025大小模型端云协同赋能人机交互报告(附PDF下载)
【精选报告】浙江大学公开课第二季:DeepSeek时代:让AI更懂中国文化的美与善(附PDF下载)
【精选报告】浙江大学公开课第二季:智能音乐生成:理解·反馈·融合(附PDF下载)
6份浙江大学的DeepSeek公开课第三季专题系列教程
【精选报告】浙江大学公开课第三季:走进海洋人工智能的未来(附PDF下载)
【精选报告】浙江大学公开课第三季:当艺术遇见AI:科艺融合的新探索(附PDF下载)
【精选报告】浙江大学公开课第三季:AI+BME,迈向智慧医疗健康——浙大的探索与实践(附PDF下载)
【精选报告】浙江大学公开课第三季:心理学与人工智能(附PDF下载)
【AI加油站】第八部:《模式识别(第四版)-模式识别与机器学习》(附下载)
人工智能产业链联盟高端社区

一次性说清楚DeepSeek,史上最全(建议收藏)
DeepSeek一分钟做一份PPT
用DeepSeek写爆款文章?自媒体人必看指南
【5分钟解锁DeepSeek王炸攻略】顶级AI玩法,解锁办公+创作新境界!
【中国风动漫】《雾山五行》大火,却很少人知道它的前身《岁城璃心》一个拿着十米大刀的男主夭折!

免责声明:部分文章和信息来源于互联网,不代表本订阅号赞同其观点和对其真实性负责。如转载内容涉及版权等问题,请立即与小编联系(微信号:913572853),我们将迅速采取适当的措施。本订阅号原创内容,转载需授权,并注明作者和出处。如需投稿请与小助理联系(微信号:AI480908961)
编辑:Zero





- 点赞 0
-
分享
微信扫一扫
-
加入群聊
扫码加入群聊