偏好约束推理:语言模型在多对一匹配市场的基准测试
人工智能
2025-09-17 v1
摘要
近期大型语言模型(LLM)推理能力的进展在复杂数学任务中展现出强大的性能,包括组合优化。链式思维(Chain-of-Thought)和情境学习(In-Context Learning)等技术进一步提升了这一能力,使 LLM 成为广泛用户(包括非专家)强大且可及的工具。然而,将 LLM 应用于需要在偏好和结构约束下进行推理的匹配问题仍未得到充分探索。为填补这一空白,我们引入了一个包含 369 个实例的新基准测试,这是 College Admission Problem 的一个新型基准,作为偏好匹配问题的典型例子,以评估 LLM 在可行性、稳定性和最优性等关键维度上的表现。我们使用该基准评估了Several open-weight LLM的性能。我们的结果首先揭示,尽管 LLM 可以满足某些约束,但在始终满足所有评估标准方面存在困难。我们还发现,像 QwQ 和 GPT-oss 这类推理 LLM显著优于传统模型,如 Llama、Qwen 或 Mistral,这些模型被定义为没有任何专门推理机制的模型。此外,我们观察到 LLM 对所测试的各种提示策略作出了不同的反应,这些策略包括链式思维、情境学习和基于角色的提示,其中没有单一的提示策略能提供最佳性能。最后,我们报告了在迭代提示并使用自动生成反馈后的表现,发现其并非单调递增;在后续尝试中可能会提前达到峰值,然后显著下降。总体而言,本工作为模型推理性能及提示策略在带偏好约束的组合优化问题中的有效性提供了新的视角。
引用
@article{arxiv.2509.13131,
title = {Reasoning with Preference Constraints: A Benchmark for Language Models in Many-to-One Matching Markets},
author = {Marylou Fauchard and Florian Carichon and Margarida Carvalho and Golnoosh Farnadi},
journal= {arXiv preprint arXiv:2509.13131},
year = {2025}
}