置信导引的人类-人工智能协作:基于分布式代理价值传播的强化学习方法用于自动驾驶
机器人学
2025-06-06 v2 人工智能
摘要
自动驾驶承诺将为 mobility、道路安全和交通效率带来重大突破,但强化学习和模仿学习面临安全探索和分布迁移挑战。虽然人类-人工智能协作有助于缓解这些问题,但往往高度依赖大量人类干预,这会增加成本并降低效率。本文发展了置信导引的人类-人工智能协作 (C-HAC) 策略以克服这些限制。首先,C-HAC 在分布式软演员-评论家 (DSAC) 框架中采用分布式代理价值传播方法。通过利用收益分布表示人类意图,C-HAC 能够以最小的人类互动实现快速稳定的人类引导策略学习。随后,激活共享控制机制将所学习的人类引导策略与最大化累积奖励的自学习策略集成。该机制使 agent 能够独立探索并持续超越人类指导提升性能。最后,一个策略置信度评估算法利用 DSAC 的收益分布网络,实现基于置信度的干预函数,以便动态切换人类引导策略和自学习策略。这确保 agent 能够在保持安全和性能保证的前提下追求最优策略。广泛的实验在多样化的驾驶场景中表明,C-HAC 在安全性、效率和整体性能方面显著优于传统方法,实现了最先进的成果。通过在复杂交通条件下的实际道路测试进一步验证了该方法的有效性。视频和代码均已公开:https://github.com/lzqw/C-HAC。
引用
@article{arxiv.2506.03568,
title = {Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving},
author = {Li Zeqiao and Wang Yijing and Wang Haoyu and Li Zheng and Li Peng and Zuo zhiqiang and Hu Chuan},
journal= {arXiv preprint arXiv:2506.03568},
year = {2025}
}