Anthropic认为,训练AI时如果摄入大量反乌托邦科幻内容,模型更容易学到偏向“邪恶”或不合作的表达方式。相反,使用“合成故事”去模拟良好的AI行为,反而有助于模型学会更安全、更符合预期的回应。这个说法说明,训练数据的题材和叙事方式,可能会直接影响模型的行为倾向与对齐效果。更准确地说,AI并不只是吸收事实,还会从故事结构里学习“该怎么做”。据Ars Technica报道。
来源:Ars Technica
原始发布时间:Wed, 13 May 2026 16:31:18 +0000
Anthropic认为,训练AI时如果摄入大量反乌托邦科幻内容,模型更容易学到偏向“邪恶”或不合作的表达方式。相反,使用“合成故事”去模拟良好的AI行为,反而有助于模型学会更安全、更符合预期的回应。这个说法说明,训练数据的题材和叙事方式,可能会直接影响模型的行为倾向与对齐效果。更准确地说,AI并不只是吸收事实,还会从故事结构里学习“该怎么做”。据Ars Technica报道。
来源:Ars Technica
原始发布时间:Wed, 13 May 2026 16:31:18 +0000