Computers and Society · Computer Science
Aligning AI With Shared Human Values
Dan Hendrycks, Collin Burns, Steven Basart, Andrew Critch +3
2023-02-20
Computation and Language · Computer Science
One Model, Many Morals: Uncovering Cross-Linguistic Misalignments in Computational Moral Reasoning
Sualeha Farid, Jayden Lin, Zean Chen, Shivani Kumar +1
2025-09-29
Computation and Language · Computer Science
MoralBench: Moral Evaluation of LLMs
Jianchao Ji, Yutong Chen, Mingyu Jin, Wujiang Xu +2
2025-07-08
Artificial Intelligence · Computer Science
Should We Really Edit Language Models? On the Evaluation of Edited Language Models
Qi Li, Xiang Liu, Zhenheng Tang, Peijie Dong +3
2024-10-25
Computation and Language · Computer Science
Rethinking Machine Ethics -- Can LLMs Perform Moral Reasoning through the Lens of Moral Theories?
Jingyan Zhou, Minda Hu, Junan Li, Xiaoying Zhang +3
2024-07-02
Computers and Society · Computer Science
LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models
Junfeng Jiao, Saleh Afroogh, Abhejay Murali, Kevin Chen +2
2025-05-05
Computation and Language · Computer Science
Reasoning Elicitation in Language Models via Counterfactual Feedback
Alihan Hüyük, Xinnuo Xu, Jacqueline Maasch, Aditya V. Nori +1
2025-03-18
Computers and Society · Computer Science
ClarityEthic: Explainable Moral Judgment Utilizing Contrastive Ethical Insights from Large Language Models
Yuxi Sun, Wei Gao, Jing Ma, Hongzhan Lin +2
2025-04-10
Computation and Language · Computer Science
Speaking Multiple Languages Affects the Moral Bias of Language Models
Katharina Hämmerl, Björn Deiseroth, Patrick Schramowski, Jindřich Libovický +3
2023-06-02
Computation and Language · Computer Science
Do Large Language Models Understand Morality Across Cultures?
Hadi Mohammadi, Yasmeen F. S. S. Meijer, Efthymia Papadopoulou, Ayoub Bagheri
2025-07-30
Computation and Language · Computer Science
Detecting Edit Failures In Large Language Models: An Improved Specificity Benchmark
Jason Hoelscher-Obermaier, Julia Persson, Esben Kran, Ioannis Konstas +1
2023-06-06
Computers and Society · Computer Science
Unpacking the Ethical Value Alignment in Big Models
Xiaoyuan Yi, Jing Yao, Xiting Wang, Xing Xie
2023-10-27
Computation and Language · Computer Science
MoralDial: A Framework to Train and Evaluate Moral Dialogue Systems via Moral Discussions
Hao Sun, Zhexin Zhang, Fei Mi, Yasheng Wang +5
2023-05-29
Computation and Language · Computer Science
Histoires Morales: A French Dataset for Assessing Moral Alignment
Thibaud Leteno, Irina Proskurina, Antoine Gourru, Julien Velcin +3
2025-01-29
Computation and Language · Computer Science
Smaller Large Language Models Can Do Moral Self-Correction
Guangliang Liu, Zhiyu Xue, Xitong Zhang, Rongrong Wang +1
2025-03-04
Computation and Language · Computer Science
Do Multilingual Language Models Capture Differing Moral Norms?
Katharina Hämmerl, Björn Deiseroth, Patrick Schramowski, Jindřich Libovický +2
2022-03-21
Computation and Language · Computer Science
Revision Transformers: Instructing Language Models to Change their Values
Felix Friedrich, Wolfgang Stammer, Patrick Schramowski, Kristian Kersting
2023-07-26
Computation and Language · Computer Science
Procedural Dilemma Generation for Evaluating Moral Reasoning in Humans and Language Models
Jan-Philipp Fränken, Kanishk Gandhi, Tori Qiu, Ayesha Khawaja +2
2024-04-18
Computation and Language · Computer Science
Deconstructing The Ethics of Large Language Models from Long-standing Issues to New-emerging Dilemmas: A Survey
Chengyuan Deng, Yiqun Duan, Xin Jin, Heng Chang +14
2024-10-22