面向程序化规则的大语言模型对齐:基于自回归状态跟踪提示的游戏内交易
人工智能
2025-10-30 v1
摘要
大型语言模型(LLM)使游戏交互能够实现动态互动,但在规则驱动的交易系统中无法遵循关键的程序流程,导致玩家信任受到侵蚀。本文解决了LLM创造灵活性与游戏内交易(浏览-报价-审查-确认)程序性需求之间的核心矛盾。为此,本文引入自回归状态跟踪提示(Autoregressive State-Tracking Prompting, ASTP),这是一种以战略性编排的提示为中心的方法,迫使LLM使其状态跟踪过程显式且可验证。本文不依赖隐式的上下文理解,而是要求LLM识别并报告前一轮中预定义的状态标签。为确保交易的完整性,这一方法还配合一种用于准确价格计算的状态特定占位符后处理方法。跨300次交易对话的评估表明,状态合规率超过99%,计算精度达99.3%。值得注意的是,针对较小模型(Gemini-2.5-Flash)的ASTP配合占位符后处理,其性能已与较大模型(Gemini-2.5-Pro)相当,响应时间从21.2秒降至2.4秒,为满足商业游戏中实时需求和资源约束条件的实际应用奠定了基础。
引用
@article{arxiv.2510.25014,
title = {Aligning Large Language Models with Procedural Rules: An Autoregressive State-Tracking Prompting for In-Game Trading},
author = {Minkyung Kim and Junsik Kim and Woongcheol Yang and Sangdon Park and Sohee Bae},
journal= {arXiv preprint arXiv:2510.25014},
year = {2025}
}
备注
8 pages main content, 18 pages supplementary material, 4 figures