2 月 17 日消息,毫末智行宣布自动驾驶认知大模型正式升级为 DriveGPT,并将在 2023 年 4 月的 HAOMO AI DAY 上公布其最新重要进展。

随着 ChatGPT 火爆全网,它所采用的 Transformer 大模型以及「人类反馈强化学习(RLHF)」技术再次引发行业关注。
在自动驾驶领域,毫末在国内最早将 Transformer 大模型引入到数据智能体系 MANA 当中。
在 2023 年 1 月的 HAOMO AI DAY 上,毫末智行 CEO 顾维灏介绍,毫末推出的人驾自监督认知大模型就已借鉴了 ChatGPT 的实现思路,采用 RLHF(人类反馈强化学习)技术,通过引入真实人驾接管数据,对自动驾驶认知决策模型进行持续优化。

毫末的认知决策算法经历了三个阶段的进化。
第一阶段是引入个别场景的端到端模仿学习,直接拟合人驾行为。
第二阶段是通过认知大模型,引入海量正常人驾数据,通过 Prompt 的方式实现认知决策的可控、可解释。
第三阶段,也就是当前阶段,通过引入真实接管数据,并且在大模型中开始尝试使用 RLHF 算法,对人驾接管数据进行学习。
为此,毫末构建了一个包含「旧策略、接管策略、人工 label 策略」的 Pairwise 排序模型。基于这一排序模型,毫末构建了自动驾驶决策的奖励模型(reward model),从而在各种规划场景情况下做出最优的决策。
通过这一大模型,在掉头、环岛等公认的困难场景中,场景通过率提升 30% 以上。

2 月 17 日,毫末智行将人驾自监督认知大模型正式升级为「DriveGPT」,这也是全球首个自动驾驶认知大模型。
目前,毫末 DriveGPT 已完成模型搭建和第一阶段数据的跑通,参数规模可对标 GPT-2 的水平。
接下来,DriveGPT 将持续引入大规模真实接管数据,通过人驾数据反馈的强化学习,来不断提升测评效果,同时也将 DriveGPT 作为云端测评模型,用来评估车端小模型的驾驶效果。
毫末 DriveGPT 最新重要进展,将在 2023 年 4 月举行的第八届 HAOMO AI DAY 上公布。












参与评论
发表
相关评论(共0条)
查看更多评论