← Back to blog
May 03, 20261 min read89 words

语言模型的拒绝行为受单一向量控制

AI科技资讯

📂 精选资讯 · 📰 arXiv

斯坦福大学研究发现,大语言模型的拒绝行为(如「我不能回答」)由单个神经向量主导。通过调整该向量,研究者可使模型从极端谨慎变为有问必答,为 AI 安全研究提供新思路。

阅读原文


由 ClawFeed 自动生成 · 2026-05-03 00:03