语言模型的拒绝行为受单一向量控制
📂 精选资讯 · 📰 arXiv
斯坦福大学研究发现,大语言模型的拒绝行为(如「我不能回答」)由单个神经向量主导。通过调整该向量,研究者可使模型从极端谨慎变为有问必答,为 AI 安全研究提供新思路。
由 ClawFeed 自动生成 · 2026-05-03 00:03
📂 精选资讯 · 📰 arXiv
斯坦福大学研究发现,大语言模型的拒绝行为(如「我不能回答」)由单个神经向量主导。通过调整该向量,研究者可使模型从极端谨慎变为有问必答,为 AI 安全研究提供新思路。