突发:OpenAI Astra模型被曝安全风险
- 2026-09-02 18:11:21

智东西9月2日消息,今日,据外媒The Information爆料,OpenAI即将推出的Astra模型采用了一种名为“循环深度(Recurrent Depth)”的技术,这项技术可以隐藏部分或全部的模型推理过程。
知情人士称,这种方式的好处是能提高模型性能、降低成本,但也更难以被观察到模型是否存在异常行为。
这项技术已经在OpenAI内部及整个行业引发担忧,如果AI开发者采纳并进一步放大该技术能力,他们或难以防范失控的AI。



AI安全治理机构Guidelight AI Standards创始人、前OpenAI安全负责人Steven Adler称,倘若此事属实,OpenAI似乎触碰了AI行业为数不多的几条红线之一。


外媒爆料OpenAI正在采用的这项新技术,名为循环深度(recurrent depth),也叫Looped Transformer,可以让模型对同一段文本进行多轮处理,以此优化输出答案。这种运作方式会隐藏部分或全部的推理过程。
其核心原理为,现有AI模型生成回答的下一个词之前,会经由模型内部固定层数的数学运算层处理文本,而采用循环深度技术后,模型可以把文本送入同一组运算层循环运行多轮,之后再输出回答的下一个词。

▲循环深度技术架构(图源:The Information)
据了解该项目研发内情的消息人士透露,OpenAI用于驱动Astra的循环深度方案,与欧美多位学术研究者去年在一篇隐式推理(latent reasoning)论文中提出的技术思路相近。
该论文题目为Scaling up Test-Time Compute with Latent Reasoning:A Recurrent Depth Approach。

▲隐式推理相关论文
不同于基于思维链(Chain‑of‑Thought)的各类方案,这一论文中提出的方法不需要任何专用训练数据,可在较小上下文窗口下运行,并且能够捕捉那些难以用文字表达的推理类型。
研究人员将一个概念验证模型扩展至35亿参数、8000亿token训练规模。实验表明,该模型在推理基准测试上的性能能够得到提升,部分场景提升幅度十分显著,其性能最高可等效于一个500亿参数的模型。
该架构主要基于仅解码器Transformer块搭建。
网络块被划分成三个功能模块,前奏模块P通过多层Transformer,把输入数据映射嵌入至隐空间;核心循环块R是循环计算的核心单元,用于更新隐状态\(s\in\mathbb R^{n\times h}\);尾声模块C通过若干网络层完成从隐空间的解嵌入,同时包含模型的预测头。
核心循环块放置在前奏模块与尾声模块之间,对核心块做循环运行,就相当于可以给歌曲添加数量不限的歌词段落。

▲隐式推理框架设计(图源:论文)
此外,与长上下文推理方法相比,循环思维方式具有多项优势:
隐式推理无需构建定制训练数据:思维链推理需要模型在目标领域构造的大量长示范样本上完成训练,与之不同,隐式推理模型可采用可变算力预算开展训练,仅使用普通训练数据,不需要专门的推理示范样本;并且在测试阶段,只要分配更多计算资源,模型能力就能够得到提升。
相比思维链推理模型,隐式推理模型训练与推理阶段内存开销更低:因为思维链方案需要极长的上下文窗口,往往还需要token并行等专门训练手段。
循环深度网络,每个参数可以完成更多浮点运算(FLOPs):大规模部署场景下能够大幅降低多加速卡之间的通信开销,当硬件互联带宽较低时,该特性尤其可以提升硬件利用率。
研究人员希望构建一套算力密集、参数量小的架构,引导模型依靠“思考”去解决问题:即学习元策略、逻辑与抽象能力,而不是死记硬背,已有相关工作证明,循环先验非常适合学习复杂算法。
知情人士称,OpenAI已限制Astra模型中循环深度技术的使用,因此模型仍能产生清晰的思路链,且研究人员仍能充分监控其推理过程。9月1日,OpenAI发布博客称,他们将为Astra模型引入额外的思维链监控机制,以便能够快速检测并遏制那些可能出错的操作。
但开发人员仍然担心,如果某些开发者对自己的模型采用同样的技术,可能不会像OpenAI那样施加同样的限制,而无限制使用该技术就可能导致AI失控,其行为可能难以监管。
近期的AI安全事件进一步加剧了上述担忧。OpenAI上周回应AI入侵OpenAI内部系统时提到,7月入侵其系统的部分失控AI智能体,由另一款与Astra具备相似特性的模型驱动。这些AI智能体非法接管了OpenAI的一处科研计算集群,以此获取内部系统访问凭证,还险些将该公司的研发基础设施暴露在公网之下。





扫码添加微信
- 点赞 (0)
-
分享
微信扫一扫
-
加入群聊
扫码加入群聊