普通语言之外的安全性

安全训练往往聚焦于自然语言交互。CipherChat 研究这些安全措施能否同样适用于语言模型仍然能够理解的编码对话。

评估安全缺口

该研究在中英文环境下,围绕 11 个安全领域评估了 GPT-3.5 Turbo 和 GPT-4。结果发现,被测模型理解密文的能力并不总能伴随安全的回复,因此有必要评估普通语言之外的安全性。这些结论适用于 ICLR 2024 论文中评估的模型版本与实验设置。

了解这项研究

论文介绍了评估与分析,官方仓库提供了研究代码与数据。