关于策略类型先验信念实际影响的实证研究
人工智能
2019-07-12 v1 多智能体系统
摘要
许多多智能体应用要求一个智能体快速学会如何与先前未知的其他智能体交互。为解决该问题,研究者已研究基于其他智能体观测动作计算对一组假设策略的后验信念的学习算法。后验信念由先验信念补充,先验信念指定在观测到任何动作之前策略的主观似然。在本文中,我们呈现了关于重复交互中策略先验信念实际影响的首个全面实证研究。我们表明先验信念对此类方法的长期性能可能有显著影响,且影响幅度取决于规划视界的深度。此外,我们的结果表明自动方法可用于计算具有一致性能效应的先验信念。这表明先验信念可作为手动参数被消除,转而自动计算。
引用
@article{arxiv.1907.05247,
title = {An Empirical Study on the Practical Impact of Prior Beliefs over Policy Types},
author = {Stefano V. Albrecht and Jacob W. Crandall and Subramanian Ramamoorthy},
journal= {arXiv preprint arXiv:1907.05247},
year = {2019}
}
备注
Proceedings of the 29th AAAI Conference on Artificial Intelligence (AAAI), 2015. arXiv admin note: substantial text overlap with arXiv:1507.07688