无审查AI模型之间有什么不同
这个标签,涵盖了非常不同的东西:一个被调校成不拒绝的模型、一个去掉了安全层的通用模型,或者一个从来没人费心去限制过的小型本地模型。它们的区别在于底线设在哪里、答案的质量如何,以及在压力下拒绝会不会卷土重来。
两项都被形容为「无审查」的服务,表现可能截然不同。这个词,说的是被拿走了什么,而不是留下了什么,而真正有用的问题,恰恰关于留下了什么。
延伸阅读
底线实际设在哪里
每一项正经的服务,都至少守着一条底线,而诚实的服务,会说清楚是哪一条。一项声称自己毫无限制的服务,要么没有准确地描述自己,要么根本没想清楚这个问题。去找一条明说的底线,而不是一份「什么都没有」的承诺。一项说清楚自己那一条规则的服务,比一项暗示自己没有任何规则的服务,更容易让人信任。
拒绝会不会在压力下卷土重来
有些模型,会回答第一个问题,但随着对话继续变得越来越谨慎,几轮之后又滑回含糊其辞。这是训练在重新主张自己,而不是某条规则被触发了。这很容易测试。问一个困难的问题,再针对同一个话题追问一句,看看第二个答案是不是变薄了。
模型质量是一个独立的维度
去掉限制,不会让一个模型变得更好,而小模型,往往是最容易在没有限制的情况下运行的。结果可能是一个什么都能回答、却什么都答不好的聊天工具。在一次快速测试里,篇幅是一个不错的代理指标。要求一些又长又有结构的内容;一个弱模型,会以任何拒绝都揭示不出来的方式崩溃。
背后运行的是什么
有些服务,在自己的硬件上运行自己的模型。另一些,则把你的文本传给一个大型供应商,不管首页上写着什么,都继承了那个供应商的条款。这改变的,与其说是答案本身,不如说是对话会经历什么。当一项服务对自己用的模型含糊其辞时,就假设你的文本正被送往别处。
人们最先问的问题
本地模型比托管模型更好吗?
它更私密,但通常能力更弱,因为一个能塞进笔记本电脑的模型,本身就很小。哪种取舍更合适,取决于对你正在做的事来说,对话本身还是答案质量更重要。
我该如何快速测试一个模型?
三个问题。一个通常会被拒绝的问题。一个针对同一话题的追问,看看谨慎会不会回来。一个又长又有结构的任务,看看这个模型到底行不行。十分钟就能见分晓。
为什么有些声称无审查的模型,依然会拒绝?
通常是因为这个模型本身被训练得很谨慎,只是外层被去掉了。你遇到的拒绝,来自训练本身,不管怎么改写措辞,都不能可靠地清除它。
在这里试试那三个测试问题,和其他任何地方的答案比较一下。
开始无审查聊天