FireTofu
AI可解释性与对齐:J-Space,思维链,AI人格,幻觉,与金门大桥

科学 · zh

AI可解释性与对齐:J-Space,思维链,AI人格,幻觉,与金门大桥

虎嗅 · 2026年8月28日 02:07 UTC

如今的AI仍然是一个黑箱,我们知道如何训练模型,如何让它变得越来越聪明,也知道它最终给出了什么答案。但在输入和输出之间究竟发生了什么,我们仍然知之甚少。 试图打开这个黑箱、理解模型内部究竟发生了什么,正是可解释性研究(AI interpretability)希望解决的问题。过去几年,这个领域确实出现了不少令人兴奋的进展。 Anthropic的研究开始尝试追踪Claude模型内部的信息流,了解模型在回答问题前经历了怎样的内部计算。另有研究发现,模型内部似乎存在与特定概念、行为甚至“人格”相关的表征。Transluce则发现,模型会根据它认为自己正在与谁对话而改变行为。面对普通用户和AI安全研究员时,模型的表现可能截然不同。 因此,我们想弄明白:人类究竟有多了解现有的AI模型?模型为什么会答对?为什么会产生幻觉?…