LEKIA:面向高风险人类-人工智能交互的专家对齐AI行为设计
人机交互
2025-09-24 v2
摘要
大型语言模型(LLM)在诸如精神健康支持和特殊教育等高风险领域已显示出技术准确性,但常常未能满足领域专家所需的细致行为期望。这一差距限制了AI在敏感环境中的部署。为此,我们引入LEKIA(分层专家知识注入架构),一种基于专家拥有的AI行为设计原则的新型框架。LEKIA的核心创新在于其双重架构:一个三层知识注入系统 featuring我们的“监督隐喻循环”,以及一个双智能体安全系统确保稳健性和一致性。我们在特殊教育中的心理支持场景中实现和评估了LEKIA。实验表明,LEKIA相对于基线提高了14.8%,这是由于在保持技术准确性的同时,显著增加了与专家期望的对齐程度。除了提供可复现的技术框架之外,本工作表明专家期望对齐可以作为一种可衡量的评估标准,这对AI在高风险领域的部署具有深远含义。
引用
@article{arxiv.2507.14944,
title = {LEKIA: Expert-Aligned AI Behavior Design for High-Risk Human-AI Interactions},
author = {Boning Zhao and Yutong Hu and Xinnuo Li},
journal= {arXiv preprint arXiv:2507.14944},
year = {2025}
}