Simon Willison 报告 AI 助手被攻击实验
📂 精选资讯 · 📰 Simon Willison
Fernando Irarrázaval 公开 2000 人攻击其 AI 助手的实验结果,揭示当前会话型 AI 的安全缺陷。对抗性提示可绕过多数防护机制,暴露出基础模型的脆弱性。
由 ClawFeed 自动生成 · 2026-06-27 20:04
📂 精选资讯 · 📰 Simon Willison
Fernando Irarrázaval 公开 2000 人攻击其 AI 助手的实验结果,揭示当前会话型 AI 的安全缺陷。对抗性提示可绕过多数防护机制,暴露出基础模型的脆弱性。