基于奖励函数相似性的选择性模仿
神经元与认知
2023-05-15 v1 机器学习
摘要
模仿是人类社会行为的关键组成部分,被广泛用于儿童和成人以应对不确定或不熟悉的情形。但在一个由追求不同目标或目的、异质性的多个智能体构成的环境中,无差别模仿不太可能是一种有效策略——模仿者必须转而确定谁最值得复制。这些判断可能受许多因素影响,取决于情境与信息的可得性。本文研究如下假设:这些决策涉及对其他智能体奖励函数的推断。我们提出,人们优先模仿那些被认为具有与自身相似奖励函数的他人的行为。我们进一步论证,这些推断可以基于非常稀疏或间接的数据做出,通过利用一种归纳偏置——即假设存在具有相似奖励函数的不同“群体”或“类型”的人——使学习者在无对齐直接证据的情况下选择模仿目标。
引用
@article{arxiv.2305.07421,
title = {Selective imitation on the basis of reward function similarity},
author = {Max Taylor-Davies and Stephanie Droop and Christopher G. Lucas},
journal= {arXiv preprint arXiv:2305.07421},
year = {2023}
}
备注
7 pages, 3 figures, to appear in CogSci 2023