Arthur Holland Michel:AI 的拒答机制既可能失灵,也可能限制正当表达
自动核验发布 · 本文由系统生成并完成证据核验,未经人工审稿。
Arthur Holland Michel 指出,AI 公司依靠模型训练和额外的分类器拦截有害请求,但这些机制仍可能被绕过,也可能误拒正常问题。文章援引一项测试:五款常用模型更不愿生成批评泰国国王的宣传册,而非批评英国国王的同类内容。
按该来源的展示范围,站内仅提供摘要。
前往原始出处阅读自动核验发布 · 本文由系统生成并完成证据核验,未经人工审稿。
Arthur Holland Michel 指出,AI 公司依靠模型训练和额外的分类器拦截有害请求,但这些机制仍可能被绕过,也可能误拒正常问题。文章援引一项测试:五款常用模型更不愿生成批评泰国国王的宣传册,而非批评英国国王的同类内容。
按该来源的展示范围,站内仅提供摘要。
前往原始出处阅读