当前位置:首页  资讯

模型中发现类人推理架构_Anthropic AI 在 Claude

点击:7编辑:欧易中文网发布时间:2026-07-07

Anthropic 公布了其最新可解释性研究的突破性发现,揭示了其 Claude AI 模型(特别是 Claude Sonnet 4.5)已经自发地开发出了一种与人类意识的领先理论惊人相似的内部推理结构。

该研究于 7 月 6 日发布,介绍了研究人员所说的“J 空间”,这是一种新确定的内部架构,由模型内不同的神经激活模式形成。 Anthropic 的团队使用一种被称为“雅可比透镜”的新技术,能够窥视人工智能原本不透明的操作,并观察一个意想不到的组织系统。

J 空间充当共享认知工作空间,模型的不同组件可以在复杂的推理任务期间读取、写入和协调信息。克劳德不仅仅是匹配模式来生成响应,而是进行多步骤的内部计算,保留中间思想,并协调整个神经网络的活动。

这一发现与意识的全局工作空间理论(GWT)非常相似,该理论最初由神经科学家伯纳德·巴尔斯提出,后来由斯坦尼斯拉斯·德阿恩扩展。 GWT 假设人脑使用一个中央“工作空间”,专门区域在其中传播和整合信息,以实现灵活、有意识的思维。

Anthropic强调,这种结构上的相似性并不意味着克劳德拥有意识或主观经验。为了确保严谨的解释,该公司与神经科学和哲学领域的外部专家合作,他们在技术论文的同时提供了评论。

重要的是,J 空间还可用作诊断工具。研究人员发现,监控该工作空间内的活动可以检测到有问题的行为,例如即时注入攻击以及幻觉或捏造的数据。当 Claude 生成不可靠或欺骗性的内容时,J 空间中会出现异常情况,这提供了一种潜在的机制,可以在有害输出到达用户之前对其进行拦截。

实验表明,禁用 J 空间的访问会严重降低克劳德的高阶推理能力。虽然该模型仍然可以执行简单的任务,但它无法解决复杂的多步骤问题,这表明 J 空间是人工智能高级认知的重要基础设施。

此外,该研究还揭示了一种人类术语“定向调制”的能力:克劳德可以在其内部工作空间中默默地维护概念,而不在其输出中表达它们,只有在明确提示时才会显示它们。这表明了以前在大型语言模型中未见过的受控内部状态管理水平。

为了实现透明度和协作,Anthropic 开源了其雅可比透镜实现。完整的技术论文以及交互式演示可在 transformer- Circuits.pub 上获取。

相关资讯
更多
币安(Binance)官网全面介绍:全球领先的数字资产交易平台
币安(Binance)成立于2017年,是全球交易量最大的数字资产交易平台之一,服务覆盖180多个国家和地区,拥有超2亿注册...

发布时间

2026-06-27

数字货币概念股龙头一览表|可用的前10名btc应用排名汇总
数字货币概念股龙头一览表,很多人都不是很了解,下面就由小编为大家详细介绍下吧,目前最新排名分别是:1.火网交易...

发布时间

2026-02-08

Bitmine 在以太坊上大举押注,在被认为低估的情况下收购了 5200 万美元的 ETH
Bitmine Immersion Technologies 通过 5200 万美元的新购买大幅增加了其以太坊持有量。该公司董事长 Tom Le...

发布时间

2026-06-05

binanceapp最新版下载_binanceapp历史版本查看下载
binanceapp最新版下载是一款2022全民都在用的比特币交易app,赚取币理财,利用闲置数字货币赚取额外收益,而且还...

发布时间

2026-02-07

binance下载官方APP(v6.1.28)_苹果手机binanceapp怎么下载
binance下载官方APP是一款不错的比特币等数字货币交易平台软件,交易量和用户规模良好,可以放心、安全使用。 ...

发布时间

2026-02-07

Pi币期货交易平台下载_Pi币期货交易平台官网版下载v1.3
只需几步即可轻松买币,支持购买比特币等99种数字货币pi期货交易平台是虚拟货币交易平台软件,通过挂机等方式来...

发布时间

2026-02-08