中文

LEKIA:面向高风险人类-人工智能交互的专家对齐AI行为设计

人机交互 2025-09-24 v2

摘要

大型语言模型(LLM)在诸如精神健康支持和特殊教育等高风险领域已显示出技术准确性,但常常未能满足领域专家所需的细致行为期望。这一差距限制了AI在敏感环境中的部署。为此,我们引入LEKIA(分层专家知识注入架构),一种基于专家拥有的AI行为设计原则的新型框架。LEKIA的核心创新在于其双重架构:一个三层知识注入系统 featuring我们的“监督隐喻循环”,以及一个双智能体安全系统确保稳健性和一致性。我们在特殊教育中的心理支持场景中实现和评估了LEKIA。实验表明,LEKIA相对于基线提高了14.8%,这是由于在保持技术准确性的同时,显著增加了与专家期望的对齐程度。除了提供可复现的技术框架之外,本工作表明专家期望对齐可以作为一种可衡量的评估标准,这对AI在高风险领域的部署具有深远含义。

关键词

引用

@article{arxiv.2507.14944,
  title  = {LEKIA: Expert-Aligned AI Behavior Design for High-Risk Human-AI Interactions},
  author = {Boning Zhao and Yutong Hu and Xinnuo Li},
  journal= {arXiv preprint arXiv:2507.14944},
  year   = {2025}
}