基于 Actor-Critic 优化的目标识别
机器学习
2025-01-06 v1 人工智能
多智能体系统
摘要
目标识别旨在从观察序列中推断智能体的目标。现有方法常依赖手动工程的领域和离散表示。基于深度强化学习的深度识别使用 Actor-Critic 优化(DRACO)是一种新方法,克服了这些限制,提供了两个关键贡献。首先,DRACO是首个从非结构化数据中学习策略网络并用于推断的目标识别算法。其次,DRACO引入了通过连续策略表示评估目标假设的新指标。DRACO在离散设置下实现了目标识别的现代水平,而无需使用现有方法所用的结构化输入。此外,在更具挑战性的连续设置中,DRACO在计算和内存成本大幅降低的情况下也优于这些方法。这些结果共同展示了该新算法的鲁棒性,桥接了传统目标识别和深度强化学习。
关键词
引用
@article{arxiv.2501.01463,
title = {Goal Recognition using Actor-Critic Optimization},
author = {Ben Nageris and Felipe Meneguzzi and Reuth Mirsky},
journal= {arXiv preprint arXiv:2501.01463},
year = {2025}
}