从指标到意义:人机协作设计评估的时代重思
人机交互
2025-10-29 v2 人工智能
计算工程、金融与科学
神经与进化计算
摘要
随着AI系统在创意设计情境中日益影响决策,理解人类如何与这些工具互动已成为智能交互系统研究的关键挑战。本文提出了对如何评估人机协作系统进行重构的挑战,主张采用更细致和多维的方法。来自目前最大规模field研究(n=808)的人机共创系统——Genetic Car Designer,辅以受控实验室研究(n=12)的结果被呈现。该系统基于交互进化算法,参与者被要求设计一个简单的二维汽车表示。参与者被暴露于由智能系统MAP--Elites生成的设计构图,以及随机控制。结果表明,暴露于MAP--Elites生成的构图显著增强了认知和行为参与度,导致更高质量的设计结果。对于更广泛社区至关重要的是,分析揭示了常规评估方法——通常仅关注行为和设计质量指标——无法捕捉用户参与的完整谱系。通过将人机设计过程视为设计师情感、行为和认知状态的变化,本文提出要全面评估人机系统,并将智能系统视为用户体验的核心部分——而不仅仅是后台工具。
关键词
引用
@article{arxiv.2402.07911,
title = {From Metrics to Meaning: Time to Rethink Evaluation in Human-AI Collaborative Design},
author = {Sean P. Walton and Ben J. Evans and Alma A. M. Rahat and James Stovold and Jakub Vincalek},
journal= {arXiv preprint arXiv:2402.07911},
year = {2025}
}
备注
31 pages, under review