中文

双任务范式下深度强化学习智能体的时间决策调制

人工智能 2025-11-04 v1

摘要

本研究从人工智能(AI)视角探讨了双任务范式中时间处理的干扰。在此语境下,双任务设置实现为简化版的Overcooked环境,包含两种变体:单任务(T)和双任务(T+N)。这两种变体都包含嵌入式时间生产任务,但双任务(T+N)额外涉及并行的数字比较任务。分别训练了每个任务的两个深度强化学习(DRL)智能体。这些智能体表现出与人类时间研究相符的涌现行为。具体而言,双任务(T+N)智能体相对于其单任务(T)对应物,产生了显著的过度时间生产。该结果在四个目标持续时间上均一致。对LSTM层中神经动力学的初步分析未发现任何关于专用或内在计时器的明确证据。因此,需要进一步研究以更好地理解智能体的时间保持机制,并提供对观察到的行为模式的解释。该研究是探索DRL涌现行为与生物系统中观察到的行为之间潜在相似性的迈出小步,旨在促进对两者的更好理解。

关键词

引用

@article{arxiv.2511.01415,
  title  = {Modulation of temporal decision-making in a deep reinforcement learning agent under the dual-task paradigm},
  author = {Amrapali Pednekar and Álvaro Garrido-Pérez and Yara Khaluf and Pieter Simoens},
  journal= {arXiv preprint arXiv:2511.01415},
  year   = {2025}
}

备注

Accepted at CogInterp workshop @ NeurIPS 2025