逻辑谜题的分步解释偏好 elicitation
人工智能
2025-11-14 v1
摘要
分步解释可以通过逐步展示如何推导出决策来解释逻辑谜题和其他满足问题。每一步包含一组约束,推导出一个或多个决策变量的赋值。然而,存在大量候选解释步骤,具有不同的约束集合和不同的决策推导。要识别最易理解的步骤,需要用户定义的目标函数来量化每一步的质量。然而,定义良好的目标函数具有挑战性。这里,来自更广泛机器学习社区的交互式偏好elicitation方法可以提供一种从成对比较中学习用户偏好的途径。我们研究了这种方法在分步解释中的可行性,并解决了与标准组合问题elicitation不同的若干限制。首先,由于解释质量使用多个子目标进行衡量且尺度差异很大,我们提出了两种动态归一化技术来重新缩放这些特征并稳定学习过程。我们还观察到许多生成的比较涉及相似的解释。为此,我们引入MACHOP(Multi-Armed CHOice Perceptron),一种新颖的查询生成策略,将非支配约束与上置置信度边界(upper confidence bound)集成,以实现多样化。我们在数独和逻辑网格谜题上使用人工用户和真实用户评估了elicitation技术。在两种情况下,MACHOP consistently produces higher-quality explanations than the standard approach。
引用
@article{arxiv.2511.10436,
title = {Preference Elicitation for Step-Wise Explanations in Logic Puzzles},
author = {Marco Foschini and Marianne Defresne and Emilio Gamba and Bart Bogaerts and Tias Guns},
journal= {arXiv preprint arXiv:2511.10436},
year = {2025}
}