普通语言之外的安全性
安全训练往往聚焦于自然语言交互。CipherChat 研究这些安全措施能否同样适用于语言模型仍然能够理解的编码对话。
评估安全缺口
该研究在中英文环境下,围绕 11 个安全领域评估了 GPT-3.5 Turbo 和 GPT-4。结果发现,被测模型理解密文的能力并不总能伴随安全的回复,因此有必要评估普通语言之外的安全性。这些结论适用于 ICLR 2024 论文中评估的模型版本与实验设置。
代表性研究
评估语言模型在密文对话中能否保持安全,揭示自然语言之外的安全对齐缺口。

安全训练往往聚焦于自然语言交互。CipherChat 研究这些安全措施能否同样适用于语言模型仍然能够理解的编码对话。
该研究在中英文环境下,围绕 11 个安全领域评估了 GPT-3.5 Turbo 和 GPT-4。结果发现,被测模型理解密文的能力并不总能伴随安全的回复,因此有必要评估普通语言之外的安全性。这些结论适用于 ICLR 2024 论文中评估的模型版本与实验设置。
· + 同等贡献
本页介绍依据所链接的公开来源。