沃资讯
科技 财经 汽车 游戏 数码 资讯 商业

DeepMind新突破:AI智能体自主发现RL算法,性能超主流算法

2025-10-28来源:快讯编辑:瑞雪

当人工智能(AI)开始具备自主“进化”能力,人类在技术发展中的角色或将被重新定义。近日,Google DeepMind团队在权威科学期刊《自然》上发表了一项突破性研究,提出了一种名为DiscoRL的全新方法,使智能体(Agent)能够在多环境交互中自主发现强化学习(RL)规则,无需依赖人类设计的算法。实验表明,该方法在Atari游戏基准测试中超越了MuZero等主流RL算法,并在未见过的环境中展现出高效稳定的性能。

强化学习是AI实现自主决策的核心技术之一,但长期以来,如何让智能体自主开发高效的RL算法一直是研究难点。传统方法依赖人类专家设计算法,不仅耗时费力,且难以适应复杂多变的环境。DeepMind团队提出的DiscoRL通过多代智能体在不同环境中的交互经验,实现了RL规则的自主发现。其核心在于结合智能体优化与元优化:智能体通过更新策略和预测优化自身参数,元网络则通过调整学习规则的目标,最大化智能体的累积奖励。

具体而言,智能体的训练过程涉及两类优化:在智能体优化阶段,研究团队采用Kullback–Leibler散度衡量策略与预测的差距,确保训练稳定性。智能体会输出策略(π)、观测预测(y)、动作预测(z)等结果,元网络为其生成学习目标,智能体据此更新自身参数。同时,模型引入辅助损失函数,优化动作价值与策略预测,提升学习效率。在元优化阶段,多个智能体在不同环境中独立学习,元网络根据整体表现计算元梯度,调整自身参数以最大化累积回报。智能体参数定期重置,使学习规则能在有限时间内快速提升性能。

为验证DiscoRL的有效性,研究团队以四分位数平均值(IQM)作为综合性能指标,在Atari基准测试中进行了评估。基于57款Atari游戏训练的Disco57规则,在相同游戏中的IQM得分达13.86,超越了MuZero、Dreamer等现有算法,且在实际运行效率上显著优于MuZero。进一步测试显示,Disco57在16个ProcGen二维游戏、Crafter基准测试中均表现出色,并在NetHack NeurIPS 2021挑战赛中获得第三名,且未使用任何领域特定知识。

研究还发现,环境复杂性与多样性对RL规则的泛化能力具有关键影响。基于Atari、ProcGen和DMLab-30三个基准(共103个环境)发现的Disco103规则,在Crafter基准上达到人类水平表现,并在Sokoban任务中接近MuZero的最先进性能。这表明,参与训练的环境越复杂多样,所发现的RL规则越强大,即使面对未见过的环境也能保持高效。

在效率与稳定性方面,DiscoRL同样表现突出。最优版本的Disco57规则在每个Atari游戏约6亿步内被发现,相当于在57个游戏中进行3轮实验,远低于传统人工设计算法所需的实验次数和人力投入。随着训练环境数量增加,DiscoRL在未见过的ProcGen基准上的性能持续提升,显示出强大的扩展性。

DeepMind团队指出,未来高级AI的RL算法设计可能由机器主导,通过高效扩展数据与计算能力实现自动化,无需人类干预。这一突破虽为学术领域带来新潜力,但也引发了对技术社会影响的担忧——当前社会尚未完全准备好应对此类技术的广泛应用。

分布式图数据库创新融合:赋能投资领域TB级数据毫秒响应与精准决策
分布式图数据库的融合创新,通过将节点与边的图结构模型与分布式计算架构深度结合,实现了对TB级金融数据的毫秒级查询响应,为投资决策提供了更实时、更精准的底层支撑。在投资领域,企业间的股权控制、担保链、供应链等关…

2025-10-28

多设备同步:解锁手机、电脑、平板间高效协作与数据实时流转新体验
这可以通过选择支持多设备的云存储服务来实现,它们能够在您保存或修改文件时,自动将更改应用到所有设备上。最后,利用文件夹和标签等组织工具,将相关数据归类,这样您可以快速找到所需信息,并减少寻找时间,从而提升整体…

2025-10-28

智能巡点检管理系统:以四大优势革新工业设备巡检模式
为了解决这个问题,智能巡点检管理系统应运而生,它是广州飞致创阳研发的一种基于物联网技术的设备巡检系统,利用二维码+RFID的识别方式作为创新方案进行实施,通过传感器和数据采集设备实时监测设备运行状态,可让管理…

2025-10-28

从防御到重启:构建企业网络韧性,以恢复力护航持续运营
然而,在戴尔科技最新的《网络弹性洞察报告》(以下简称“报告”)中揭示了一个残酷的事实:虽然99%的企业报告制定了网络弹性战略,但只有46%的企业从攻击或演习中成功遏制和恢复、影响最小;有53%的企业未能从上…

2025-10-28

​技术新航向:硬件突破、语言革新、云与AI共筑未来生态​
随着计算机性能足够快,语言的 “性能瓶颈” 弱化,更注重 “开发效率、学习成本、团队协作”,各语言定位清晰: 核心趋势:服务端性能瓶颈多在IO,而非语言本身;语言设计更 “以人为本”,降低使用门槛、提升协…

2025-10-27

小米17Ultra元旦前或登场!无背屏设计,影像性能续航全突破
10月27日消息,据产业链方面透露,一款型号为2512BPNDAC的新机已顺利通过相关认证,且该机支持UWB超宽带技术,由此基本可以判定这款新机就是小米17Ultra,如无意外小米17 Ultra最快能在…

2025-10-27

双11电竞鼠标选购指南:星闪技术加持,让连接稳定性不再是难题
因此,当我们将目光投向那些对性能有着极致追求的用户时,会发现他们选择的并非是功能堆砌的产品,而是侧重于在最基础也最核心的连接稳定性上,能提供绝对保障的“利器”。 这个视频展示了传统鼠标和搭载星闪技术的鼠标在…

2025-10-27

安谋科技“山海”SPU安全IP家族,全场景布局守护AI时代安全
博通集成旗下的WiFi蓝牙双模芯片BK7236凭借该方案成功斩获PSA Certified Level 2认证;欧思微的UWB芯片U101A1C9在“山海”E20的技术支持下,顺利取得国家商密L1认证,为物联…

2025-10-27

紫光同芯TMC-E9系列eSIM芯片通过GSMA eSA认证 加速全球eSIM应用
IT之家 10 月 27 日消息,今日紫光同芯官方微信公众号宣布,近日,紫光同芯 eSIM 芯片 TMC-E9 系列以行业最快速度,成功通过GSMA eUICC Security Assurance(eSA…

2025-10-27