中文

利用模型等价性求解交互式动态影响图

人工智能 2014-01-21 v1

摘要

我们关注在与其他具有相似或冲突目标且类型不确定的智能体共享的部分可观测环境中的序贯决策问题。该问题此前已被多个框架形式化,其中之一是交互式动态影响图(Interactive Dynamic Influence Diagram, I-DID),它将著名的影响图推广至多智能体环境。I-DID 是图形模型,可用于在多智能体环境中,给定智能体对物理状态及其他智能体模型的信念,计算该智能体的策略,该信念随着智能体的行动和观测而变化。正如我们所预期的,求解 I-DID 在计算上非常困难。这主要是由于归因于其他智能体的候选模型空间庞大,且随时间呈指数级增长。我们提出了两种减小模型空间规模并遏制其指数级增长的方法。这两种方法都涉及将单个模型聚合为等价类。我们的第一种方法将行为等价的模型组合在一起,并仅选择那些在更新后的模型空间中会产生与其他模型不同的预测行为的模型进行更新。第二种方法通过关注行为预测的部分来进一步压缩模型空间。具体而言,我们将聚类在单个时间步规定相同动作的动作等价模型。精确识别等价性需要我们求解初始集合中的所有模型。我们通过选择性求解部分模型来避免这一点,从而引入了近似。我们讨论了该近似引入的误差,并实证证明了由于等价性的利用,在求解 I-DID 时效率得到了提升。

关键词

引用

@article{arxiv.1401.4600,
  title  = {Exploiting Model Equivalences for Solving Interactive Dynamic Influence Diagrams},
  author = {Yifeng Zeng and Prashant Doshi},
  journal= {arXiv preprint arXiv:1401.4600},
  year   = {2014}
}