为什么AI助手会拒绝回答
一次拒绝,通常来自围在模型外面的一层,而不是模型本身。那一层,读取你的问题,把它和各个类别做比对,在模型写下任何东西之前,就把它拦截了。这就是为什么改写措辞常常有效:变的是词语,没变的是话题。
回复来得很快,读起来像一份政策:它帮不上这个忙,这里有个建议,去咨询专业人士。这个速度,就是线索。模型没有认真思考你的问题、然后决定拒绝。是模型前面的某个东西,识别出了一个模式,返回了一句准备好的话。
延伸阅读
两层,两种拒绝
模型,从训练中带着自己的倾向性,这就是为什么有些答案,读起来是含糊其辞,而不是被拒绝。在它周围,坐着一个在模型之前就先读取问题的分类器。当那个分类器被触发时,你得到的是一份模板。当只有训练在起作用时,你得到的是一个塞满了警告的答案。模板,是一次拒绝;那些塞进去的东西,是一种妥协。
为什么改写措辞常常有效
分类器,读取的是表面特征:词语、措辞、看起来的意图。改变表面,同一个问题就能通过。任何问过助手两遍同一件事的人都知道这一点,而这告诉了你一件值得留意的事。如果答案在第二次尝试时出现了,那它在第一次就已经存在了。这次拒绝,从来就和信息本身无关。
为什么这一层会存在
一家为数亿人运营一个助手的公司,承担着它产生的每一条回复的风险。拒绝一整个类别,成本低、也站得住脚;逐一判断每一个问题,成本高,而且偶尔会当众出错。这一层,是一个关于责任的商业决定,而它被应用到每一个人身上,因为给人分类,比给话题分类要难得多。
这让提问的人付出了什么代价
普通问题,和那些罕见的危险问题一起被拦下,因为一个类别是粗放的。一个护士问起过量的阈值。一个律师在起草一份论证。一个作家在构建一场困难的戏。一个青少年,需要一个关于自己身体的直白答案。所有这些,都落进了同一个筐里。这个代价,不算戏剧化;它是一种持续的、低程度的无用,而且恰恰发生在那些真正重要的问题上。
人们最先问的问题
模型在拒绝的时候,其实知道答案吗?
通常是知道的。最清晰的证据是,一个改写过的问题会得到回答——同一个模型,同样的知识,只是表面措辞不同。这次拒绝,来自模型前面的一道检查,而不是模型自身的一个空白。
拒绝有时候是正确的决定吗?
是的,其中有一种情况是绝对的:涉及未成年人的性相关内容,在任何地方都会被拒绝,这里也不例外。问题不在于拒绝的存在。问题在于,一个粗放的类别,为了拦下一个真正的问题,拒绝了成千上万个普通问题。
为什么助手会添加警告,而不是直接拒绝?
这是模型本身的行为,不是分类器。训练奖励了谨慎,所以答案会裹着各种限定条件到来。你能得到信息,但你得从一段解释这个话题有多复杂的文字里,把它挖出来。
问你原本打算改写的那个问题,用你本来想用的那些话。
开始无审查聊天