通过因果知识提升任务无关探索效率
机器学习
2024-07-31 v1 人工智能
摘要
模型训练的效果高度依赖可用训练资源的质量。然而,预算限制常常制约数据收集 efforts。为应对这一挑战,本文引入因果探索策略,利用底层因果知识进行数据收集和模型训练。我们特别关注提升任务无关强化学习中世界模型学习的样本效率和可靠性。在探索阶段,智能体主动选择预期能产生对世界模型训练最有益因果洞察的动作。同时,随着数据收集的持续进行,因果知识也在不断获取并增量细化。我们证明,因果探索能够使用更少的数据学习到准确的世界模型,并为其收敛提供理论保证。实验在合成数据和真实应用场景中进一步验证了因果探索的优势。
引用
@article{arxiv.2407.20506,
title = {Boosting Efficiency in Task-Agnostic Exploration through Causal Knowledge},
author = {Yupei Yang and Biwei Huang and Shikui Tu and Lei Xu},
journal= {arXiv preprint arXiv:2407.20506},
year = {2024}
}
备注
This paper was accepted by IJCAI'24