模型上线前应在能力与安全两个维度双验收:能力评测看语言理解、推理、生成等通用能力与学科专业能力(可复用开源评测框架与中文基准测试集);安全评测即“红队测试”——由测试人员模拟攻击者,用伪装请求、越狱提示等手段探测模型风险,评测维度包括显性风险请求的拒答能力、伪装请求下的稳健性、善意问题的可用性(不能因过度拒答影响正常使用)、滥用风险可控性等。由于越狱攻击手段与模型版本迭代都很快,静态测评难以长期反映真实风险,须建立持续红队与定期复测机制。质量与安全红线:未通过安全评测的模型不得上线;面向公众提供的生成式 AI 服务须完成备案;模型输出须经内容安全过滤。
收起>