adtop
当前位置:中国新能源汽车网  >   焦点新闻

上海期智研究院研发RL?100学习框架提升机器人抗环境扰动能力实现100

时间:2026-08-07 14:06  来源:盖世汽车  编辑:安远   阅读量:5452   
摘要: 盖世汽车讯机器人正逐渐进入家庭、公共场所、办公室、工厂以及医疗保健等各类场景。然而,尽管机器人具有巨大潜力,许多现有机器人在动态且不可预测的真实环境中的表现,仍不及其在受控实验室环境中的测试效果。 ...

盖世汽车讯 机器人正逐渐进入家庭、公共场所、办公室、工厂以及医疗保健等各类场景。然而,尽管机器人具有巨大潜力,许多现有机器人在动态且不可预测的真实环境中的表现,仍不及其在受控实验室环境中的测试效果。

据外媒报道,上海期智研究院的研究人员近日开发出一种名为RL-100的新型人工智能(AI)学习方法,可帮助机器人更快掌握新技能,并在不断变化的环境中稳定完成任务。该团队在发表于期刊《Science Robotics》的一篇论文中介绍了这一框架。RL-100融合了两种AI训练方法——模仿学习(imitation learning)和强化学习(reinforcement learning)。

论文第一作者Kun Lei在接受Tech Xplore采访时表示:“这一项目源于我们反复观察到的一个差距:机器人能够成功演示某项任务,并不意味着它能够在真实世界中稳定可靠地完成这项任务。”

Kun Lei称:“模仿学习通过让机器人学习人类示范,为其提供了良好的起点,但有限的示范数据无法覆盖所有失败情况、外部扰动或意外场景。一个机器人即便10次中成功9次,在实验室里看起来已经相当出色,但对于许多真实世界应用而言,其可靠性仍然不足。”

弥合实验室演示与真实世界应用之间的差距

为了提升机器人在真实动态环境中的表现,Kun Lei及其同事尝试将传统模仿学习策略与强化学习结合起来训练机器人策略。

模仿学习是指向机器人算法输入人类完成任务的视频,使其学习如何执行相应任务。相比之下,强化学习则通过不断试错进行训练,当AI系统采取正确行动时给予奖励,从而不断优化其决策能力。

Kun Lei表示:“我们思考,强化学习是否可以像基础模型的后训练(post-training)一样,作为机器人策略的后训练阶段。我们的核心目标,是弥合从示范到可靠执行之间的‘最后一公里’差距,不仅提升任务成功率,还提高执行速度、鲁棒性以及从错误中恢复的能力。”

研究团队提出的RL-100学习框架主要包括三个阶段。

郑重声明:此文内容为本网站转载企业宣传资讯,目的在于传播更多信息,与本站立场无关。仅供读者参考,并请自行核实相关内容。

聚焦
  • 08-07
    盖世汽车获悉,8月5日,迅铂科技通过官方渠道宣布,其承接的北汽N60项目ADC减振器已正式...
  • 08-07
    盖世汽车获悉,蔚来汽车于8月6日宣布,其NIOPower充换电网络当日新增3座站点,包括2...
  • 08-06
    8月5日,仰望全球高定中心在上海虹桥仰望中心正式开业。仰望高定秉承“前所未有,始于唯一”的...
  • 08-06
    左手千年史,右手大都会。在南京乃至全国,很少有一条城市道路能如长江路这般,将厚重历史烟火与...
  • 08-06
    盖世汽车讯8月6日,宝马中国官微宣布,宝马3系在中国市场累计销量正式突破200万辆大关。这...
  • 08-06
    8月5日,东风风神新能源8系新车——风神L8Y、L8+双车齐发,打出一套“组合拳”,不仅造...
  • 08-06
    北京时间6日,韩国股市低开,韩国综合股价指数一度跌超4%,截至9时20分,跌超3.7%。个...
  • 08-06
    盖世具身智能获悉,精密传动部件厂商陶世智能科技有限公司已于近日完成超亿元A轮融资。 本轮...
  • 08-06
    盖世汽车讯可穿戴电子设备正逐步从简单的传感器发展成为功能丰富的设备,能够做出基本决策并实时...
  • 08-05
    2026年7月,捷途汽车销售新车50108辆,全球累销超245万辆。其中,旅行小房车全系累...