ZHNDAILY
每日日报
今日精选 1 条人工筛选 · 中文科技与创新动态
01alignment.anthropic.com
Anthropic 提出 CHIVE:用反事实提示实验评估 LLM 行为解释
Anthropic Fellows 与研究人员发布 CHIVE:先从真实交互中发现意外的 LLM 行为,再通过反事实式提示改动进行实验解释。论文发现,给智能体 activation-reading 可解释性工具并未提升其对实验结果的预测;基于这类数据训练可泛化到留出场景。
意义 / 为 LLM 行为可解释性提供实证检验