新智元报道 刚刚,机器人开始自进化,迈出自主世界智能体的一大步!9月10日,在外滩大会现场,生数科技联合创始人、CEO 骆怡航带来了 生数 Motus2——一个面向灵巧操作的自我演化型通用世界模型。它要解决的,不只是让机器人学会一个动作,而是让机器人能够预演动作后果、判断结果好坏,再用这些判断改进策略。双手撕纸、...
林方舟 发自 凹非寺 量子位 | 公众号 QbitAI机器人学习拧灯泡,如果拧歪了,谁来告诉它问题出在哪,下次又该怎么改?这正是机器人“自进化”让人期待的原因:人类不可能替它示范所有情况,想让机器人越干越好,就需要它有办法评价动作的结果,并从反馈中继续学习。生数科技最新发布的Motus2,在这方面做了一次不错的尝试,走...
“前华为具身大脑一号位,以类脑思路探索世界模型,开辟一条迥异VLA的新路线。 ” 作者丨吴彤编辑丨林海峰2025年10月,朱森华做了一个创业的决定。作为华为类脑AI平台和具身大脑的负责人,他离开了这家中国最具资源禀赋的科技公司,选择了一条最小众的路径:类脑认知世界模型。他创办了具脑磐石,要做的是给机器人一个“像人一...
未来谁将掌控具身大脑?9月1日,OpenAI明确表示:将进入人形机器人。两天后,GPT-6 Astra发布。在一项测试中,它完成简单抓放的成功率达到95%,换成精细插入,却只剩10%。大模型正在进入物理世界,但从“会做”到“真正会干活”,还差一颗真正可用的“大脑”。当下,具身智能的聚光灯,也正在转向"大脑"。钱已经投了票。上半年国...
中国AGI两条上山路径:一条让机器理解、运用语言,另一条让机器认知、推演并改造世界,二者终会交汇。作者 | Ada编辑 | 漠影过去三年,通往AGI的主叙事,几乎都从语言开始:更多文本、更大参数、更长上下文、更强推理,再加上工具调用与智能体。这条路已经证明了自己的力量。它让机器能够读写、编程、检索、规划,并开始...
编辑|杨文2026 年,「世界模型」是 AI 圈最没有共识的词之一。一段能够连续生成的视频,被叫作世界模型;一个随键鼠操作实时变化的数字环境,也被叫作世界模型;在潜空间预测未来状态的系统,以及直接输出机器人动作的策略,同样使用这个名字。这些模型都在处理世界的信息,能力边界却相去甚远。生成视频里的画面可以足够...
飞行街景、导航Live、避雷指南一口气上新。作者 | 江宇编辑 | 李水青智东西9月10日报道,刚刚,高德正式推出新一代3D原生城市世界模型ABot-Earth 0.7,并将这套世界模型进一步用进飞行街景2.0、导航Live、避雷指南等AI服务中。ABot-Earth 0.7可以从一张卫星图像或一段文字出发,在单块消费级GPU上约10分钟生成公里级3D城...
金磊 发自 凹非寺量子位 | 公众号 QbitAI大火的世界模型,真的不能拿一张消费级显卡跑吗?有的,家人们,真的有的。因为就在刚刚,一个国产的、开源的世界模型,做到了!来,先来看一下第一人称射击效果:在雪地科幻场景里,角色一边移动和转动视角,一边开火,过程中还能看到爆炸、火焰、能量护盾等反馈。重点是这些变化都...
给机器人下达“准备一份早餐”的指令,它需要依次完成取餐盘、拿面包放入吐司机、接水、摆放水果等十多个步骤,过程中还要随时应对动作偏差、物品位移等突发情况。过往主流的视觉-语言-动作(VLA)模型在处理这类长时序复杂任务时,常常出现记忆缺失、泛化性不足、动作精度不达标的问题,背后的核心原因是这类模型大多采用直...
允中 发自 凹非寺量子位 | 公众号 QbitAI9月初,OpenAI下一代模型Astra的架构细节被曝光,核心关键词只有一个:循环。Astra采用了一种被称为“循环深度”(Recurrent Depth)的架构,本质是让同一组Transformer层被反复复用,用更少的参数实现更深的计算。这被外界视为OpenAI对传统“堆参数、堆算力”路线的一次重大修正——不再...
henry 发自 凹非寺量子位 | 公众号 QbitAI世界模型我见过不少,但把输入、动作、预测这条链路展示得这么明明白白的,还真·头一次见。刚刚,Scalabot发布首个世界模型HERON-World Model。只消给它一张当前画面,再告诉它接下来要执行什么动作,就能直接看到,机器人把这个动作做下去,接下来会发生什么。而且更有意思的是,...
PICO Space Pro也快来了。编译 | 陈骏达编辑 | 李水青智东西9月8日消息,昨晚,据彭博社援引知情人士消息称,字节跳动正在筹备推出一款面向实时空间视频生成的AI模型。该模型预计最快下月面世,字节创始人张一鸣正亲自督战这款新模型的开发。知情人士透露,张一鸣一直在协调公司内部各业务部门,集中AI资源和算力支持该项...
论文标题:Beyond State Consistency: Behavior Consistency in Text-Based World Models录用信息: EMNLP 2026 Main Conference论文链接:https://arxiv.org/abs/2604.13824代码开源:https://github.com/Ricardo-H/behr-wm模型开源:https://huggingface.co/collections/Ricardo-H/behr-behavior-consistent-world-models...
世界模型正在成为具身智能竞争中最受关注的技术方向之一。当大语言模型沿着参数、数据与算力不断扩展,机器人领域却面临一个更棘手的问题:真实物理世界并不是可以被无限穷举的数据集。它连续、多模态、开放,环境会变化,物体会变化,智能体也会因为自己的行动不断改变世界。于是,一个更基础的问题是:如果AI真正从屏幕进...
新智元报道 近年来,视频生成模型在清晰度、时序一致性和可控性上快速进步。给定文本、图像、相机轨迹或玩家动作,模型已经能够合成连贯的后续画面,也让「可交互视频世界」逐渐从概念走向可观看、可操作的原型。但会延续画面,并不等于会运行一个世界。镜头中的位移和碰撞只是交互最直观的一层;在更复杂的环境里,角色...
过去几年,AI的几次标志性突破,几乎都发生在数字世界:写文章、写代码、生成图片和视频。这些能力共享一个前提:对应的知识早就以文本、图像、视频等形态沉淀在互联网上,模型只管“读万卷书”就够了。但机器人要面对的,是一个有重力、有摩擦,也随时会打滑、失手的物理世界,而“一件活到底怎么干好”所需的手感、力道和临场...
机器之心发布世界模型正迎来关键转向。从 Genie、Sora 到 WorldLabs,它们已经将视觉世界模型推向了一个高度。但表象之下,它们仍是统计意义上的视觉模拟器 —— 精通像素排列,却不懂物理规律和因果逻辑。新的跃迁正在发生。近年来,具身世界模型的赛道陡然升温,备受全球 AI 大厂的关注。具身世界模型的本质是直接与物理世...
【科技纵览】过去三年,大语言模型在文本理解上突飞猛进,却在面对真实物理世界时显露出尴尬的短板。它缺乏通向现实环境的通路,这并非危言耸听。2026年7月,中国南北方同时遭遇严峻洪涝考验。南方受台风美莎克及西南季风影响,广西多地降雨量破纪录,六蓝水库溃口,留给指挥部的处置窗口不足30分钟;北方虽无台风直接登陆...
一水 发自 凹非寺量子位 | 公众号 QbitAI李飞飞这次,是真想把Atlas讲明白。「全球首个」多模态世界模型Atlas刚发布,她就拉上World Labs另外两位联创做客a16z,大聊特聊Atlas到底是什么、背后有哪些核心技术以及它到底意味着什么。△左起依次是:联创Justin Johnson和Ben Mildenhall、李飞飞、主持人Martin Casado信息量很...
允中 发自 凹非寺量子位 | 公众号 QbitAI过去三年,AI证明了自己能读懂人类的语言。但尴尬的是,它依然看不懂我们身处的物理世界。大模型缺乏通向物理世界的通路,这不是危言耸听。2026年7月,中国南北方同时遭遇严峻洪涝考验。南方,受台风美莎克及西南季风共同影响,广西遭遇持续强降雨。南宁市横州、宾阳等地多个站点降...