当前位置:首页  资讯

模型中发现类人推理架构 Claude_AI-Anthropic 在

点击:3编辑:非小号发布时间:2026-07-07

Anthropic 公布了其最新可解释性研究的突破性发现,揭示了其 Claude AI 模型(特别是 Claude Sonnet 4.5)已经自发地开发出了一种与人类意识的领先理论惊人相似的内部推理结构。

该研究于 7 月 6 日发布,介绍了研究人员所说的“J 空间”,这是一种新确定的内部架构,由模型内不同的神经激活模式形成。 Anthropic 的团队使用一种被称为“雅可比透镜”的新技术,能够窥视人工智能原本不透明的操作,并观察一个意想不到的组织系统。

J 空间充当共享认知工作空间,模型的不同组件可以在复杂的推理任务期间读取、写入和协调信息。克劳德不仅仅是匹配模式来生成响应,而是进行多步骤的内部计算,保留中间思想,并协调整个神经网络的活动。

这一发现与意识的全局工作空间理论(GWT)非常相似,该理论最初由神经科学家伯纳德·巴尔斯提出,后来由斯坦尼斯拉斯·德阿恩扩展。 GWT 假设人脑使用一个中央“工作空间”,专门区域在其中传播和整合信息,以实现灵活、有意识的思维。

Anthropic强调,这种结构上的相似性并不意味着克劳德拥有意识或主观经验。为了确保严谨的解释,该公司与神经科学和哲学领域的外部专家合作,他们在技术论文的同时提供了评论。

重要的是,J 空间还可用作诊断工具。研究人员发现,监控该工作空间内的活动可以检测到有问题的行为,例如即时注入攻击以及幻觉或捏造的数据。当 Claude 生成不可靠或欺骗性的内容时,J 空间中会出现异常情况,这提供了一种潜在的机制,可以在有害输出到达用户之前对其进行拦截。

实验表明,禁用 J 空间的访问会严重降低克劳德的高阶推理能力。虽然该模型仍然可以执行简单的任务,但它无法解决复杂的多步骤问题,这表明 J 空间是人工智能高级认知的重要基础设施。

此外,该研究还揭示了一种人类术语“定向调制”的能力:克劳德可以在其内部工作空间中默默地维护概念,而不在其输出中表达它们,只有在明确提示时才会显示它们。这表明了以前在大型语言模型中未见过的受控内部状态管理水平。

为了实现透明度和协作,Anthropic 开源了其雅可比透镜实现。完整的技术论文以及交互式演示可在 transformer- Circuits.pub 上获取。

相关资讯
更多
币安(Binance)官网全面介绍:全球领先的数字资产交易平台
币安(Binance)成立于2017年,是全球交易量最大的数字资产交易平台之一,服务覆盖180多个国家和地区,拥有超2亿注册...

发布时间

2026-06-27

1000个pi币能卖多少钱(pi币1000个以上)
大家好,今天交易所来为大家关于1000个pi币能卖多少钱(pi币1000个以上)很多人还不知道,现在让我们一起来看看吧...

发布时间

2026-02-08

买卖虚拟物品的平台(知名交易所前十推荐)
买卖虚拟物品的平台,很多人都不是很了解,下面就由小编为大家详细介绍下吧,目前最新排名分别是:1.火网交易所app...

发布时间

2026-02-08

比特币交易平台排名 2024前十名btc交易所
对于有些投资者来说,只知道买比特币能赚钱,却并不知道去哪里买比特币,那么,去哪里买比特币呢?下边小编就来盘点...

发布时间

2026-02-08

派币(π币、pi币、pinetwork、兀币)是杀猪盘!
派币(π币、pi币、pi network、兀币)是杀猪盘!近期,散户因PI下载不知名软件,暴露了自己的个人信息,丢失了个人资...

发布时间

2026-02-04

usdt-trc20是什么意思 USDT有哪些种类?
USDT是中心化的公司Tether发行的,目前市场上存在着3种不同类型的USDT。今天,白话区块链为大家简单介绍下这3种...

发布时间

2026-02-07