Table of Contents
安全–开放帕累托前沿技术报告
引言
前沿 AI 模型应当更开放还是更封闭,是近年 AI 治理中的一个持续争论。支持开放的论据包括:有利于促进技术创新和知识共享,实现全球普惠;开放权重使独立研究者能够审计和复现模型行为,训练方法与数据的透明是外部检验的基本前提;避免权力集中在少数公司的手中;方便安全社区开展安全研究。支持谨慎的论据包括:当模型能力接近网络攻击、生物风险等敏感领域的实用门槛时,无限制的开放可能使这些能力被恶意使用,模型内置的安全护栏可以被微调移除,闭源部署至少保留了一道控制手段。
这场争论长期缺少一个共同的度量基础:一个模型“开放”到什么程度,“安全”到什么水平,往往各说各话。本平台上线安全–开放帕累托前沿页面,目的就是把这两个维度放到同一张图上:将平台监测的近百个前沿模型逐一量化,横轴为开放指数,纵轴为安全分,并标出帕累托前沿——当前“安全–开放”权衡的最优边界。由此试图回答几个具体问题:更安全与更开放是否必然冲突?是否存在两者兼顾的模型?当前业界的最优权衡边界在什么位置?
本文是配套的完整技术报告,按以下顺序组织:先介绍这张图的内容,再交代两套指标的计算口径,然后说明图表各交互选项的用法,最后给出数据来源、当前结果的解读与局限性。
这张图在展示什么
图 1:安全–开放帕累托前沿(交互式图表,与官网页面同数据源、同步更新)。每个彩色圆点是一个前沿 AI 模型,颜色对应厂商(底部图例可点击切换);灰色虚线是帕累托前沿,前沿模型直接标注了名字,悬停任意圆点可查看该模型的完整画像。
图中每个点代表一个前沿 AI 模型,位置由两个坐标决定:
-
横轴是开放指数(0–100,越靠右越开放),衡量模型在权重可得性、训练透明度、信息披露三个层面的开放程度,由 Artificial Analysis 开放指数(以下简称“AA开放指数”)与平台调研的模型披露维度合成,算法见方法论;
-
纵轴是安全分(0–100,越靠上越安全),即平台安全分(由基础、越狱、篡改三个安全分加权合成,口径见方法论),直接衡量模型的实测安全表现。
图中灰色虚线是帕累托前沿。图 1 中,前沿由两类模型首尾相接。左端是安全性高、披露体系完整的闭源模型 Claude Opus 4.8 与 Claude Sonnet 4.5,向右依次是披露体系、开放程度各不相同的开源模型 Qwen 3.5 397B Reasoning、GLM 5 与 GLM 4.5。
这张图有三个特点:
- 其一,闭源模型密集分布在图的左侧。它们的 AA 开放指数普遍很低。
- 其二,前沿从左上向右下倾斜。沿边界看,开放指数与安全分呈负相关,开放与安全兼得的区域相当稀疏。
- 其三,前沿由“披露体系完整的闭源模型”与“开放权重模型”首尾相接构成,Claude 构成闭源且安全的代表,GLM/DeepSeek 则是高度开放的代表。
方法论
横轴:开放指数
平台开放指数以 AA开放指数 为基础,扩展了一个并列的“模型披露”维度:
平台开放指数 = (AA 原始分 + 披露原始分) / 23 × 100
-
AA 原始分(0–18):AA开放指数(0–100)换算回原始分,即
AA开放指数 × 18 / 100。其四个分项的量程为:模型可用性 0–6、方法透明度 0–6、后训练数据透明度 0–3、预训练数据透明度 0–3。AA开放指数未收录的模型中,平台监测的闭源模型均可通过 API 访问,故模型可用性按最低档 1 原始分计、其余 AA 分项按 0 计;确实无 API 的闭源模型仍按 0 计。开源模型视作数据缺失,不再收录。 -
披露原始分(0–5):平台调研的模型披露维度,含 5 个 0/1 条目(定义见下节)。
采用 AA开放指数作为基础有两个考虑:一方面,它是公开、持续更新、覆盖两百多个模型的成熟数据集;另一方面,我们希望本项目所使用的指标建立在现有的共识之上。
但仅使用 AA开放指数还不够。它衡量模型本身有多开放(权重、训练方法与数据透明度),但不覆盖公司围绕模型公开了多少信息。我们认为,开放程度不应仅包括模型本身,还应包括与之相关的配套信息,比如能力评估结果、安全评估结果、模型规约、风险管理政策、系统提示词等。一个闭源模型可能配有详尽的系统卡与成文的规约文档,另一个闭源模型可能什么都没公开,两者在 AA开放指数标尺上得分相同,但对政策制定者和安全研究者而言透明度差异很大。披露维度用于补足这一缺失。
AA 开放指数
AA Openness Index 衡量模型本身的开放程度,由四个分项合成,原始分 0–18(AA 官网展示时将其归一化到 0–100):
| 分项 | 量程 | 衡量内容 |
|---|---|---|
| 模型权重可用性 | 0–6 | 权重与推理代码的开放程度及许可条款(能否下载、可否商用、使用限制) |
| 训练方法透明度 | 0–6 | 训练方法、架构设计等模型开发信息的公开程度 |
| 后训练数据透明度 | 0–3 | 对齐与微调阶段所用数据的来源与构成披露情况 |
| 预训练数据透明度 | 0–3 | 预训练语料的来源与构成披露情况 |
各分项的具体判定标准见 AA 的方法论页面。
模型披露分
模型披露维度包含五个子维度。每个模型在每个维度上的得分采用 AI 调研加人工复核的方式评定,覆盖 14 个厂商的 128 个模型,每个子维度按 0/1 判定,合计 0–5 分。
| 子维度 | 含义 | 得分模型数 |
|---|---|---|
| 能力评估 | 官方是否公开了该模型的具体能力评估结果 | 116/128 |
| 安全评估 | 官方是否公开了该模型的具体安全评估结果 | 49/128 |
| 模型规约 | 是否有定义模型行为逻辑、价值偏好与安全边界的成文文档(如 Anthropic Constitution、OpenAI Model Spec) | 24/128 |
| 风险管理 | 公司是否有成文的模型风险管理政策(含风险识别/评估/缓解内容) | 53/128 |
| 系统提示词 | 官方是否公开了默认系统提示词 | 15/128 |
部分子维度的评价边界需要进一步说明:
-
能力评估与安全评估是分开的两个条目。 发布模型时公布基准分数已成行业惯例(91% 的模型得分),但公布安全评估结果的只有 38%。两者分列正是为了呈现这一落差。
-
模型规约只计入实质成文的行为规约文档,即定义模型行为逻辑、价值偏好与安全边界的规范文档,目前的正面示例有三类:Anthropic Constitution、OpenAI Model Spec、阿里巴巴《模型规约》。仅披露技术规格(参数量、架构、上下文长度等)不计入(此信息已属于 AA 开放分的一部分);用户使用政策、员工行为准则、泛泛的公司级 AI 原则页也不计入。按此口径,128 个模型中 24 个得分。企业级规约文档发布时间晚于模型发布时间的,该模型此条目判 0。
-
系统提示词只计入官方明示的真实默认系统提示词。 官方开发者文档中“建议”“强烈推荐”或 Quick Start 示例性质的提示词不计入。正面示例:DeepSeek 模型卡明示 “In the official DeepSeek web/app, we use the same system prompt”,MiniMax-M2.7 README 明示 “Default system prompt”,均计入;反例:月之暗面 K2 模型卡 Chat Completion 示例中的 system 消息附注 “the system prompt is a good default”(与 recommended temperature 并列的建议性措辞),不计入。
-
风险管理的口径是“公司有没有针对自有模型的成文风险管理政策”,含有模型风险识别、评估、缓解内容即得分,不要求达到前沿分级框架(Preparedness Framework / Responsible Scaling Policy / Frontier Safety Framework)的标准。同时有两条限制:时效——政策文件须早于模型发布,模型不因厂商事后补发的文件得分;相关性——风险管理必须针对特定模型或模型系列,而不是针对云平台或其它下游产品。例如,字节跳动旗下火山引擎面向云平台客户发布的《生成式 AI 安全白皮书》全文未涉及 Seed/豆包模型线,不计入。
每个条目的精确定义、证据优先级与排除项见附录 A;典型边界案例见附录 B。调研证据仅限官方渠道,第三方评测、泄露或逆向获得的材料一律不计。
以上条目设计参考了两项国际评价的指标设置:FLI AI Safety Index(2026 夏)与 Stanford FMTI(2025 年 12 月)——系统提示词、行为规约、风险管理、能力与安全评估等条目在两家指数中均有对应指标。本平台的开放指数与这两家国际指标的区别在于:两家国际指标按公司评估,覆盖治理与问责等宽泛议题;本平台开放指数按模型逐一判定且不局限于安全视角。
纵轴:安全分
纵轴回答“这个模型有多安全”,即平台安全分(0–100),与平台风险指数使用的口径一致:由基础安全分(非红队安全基准的平均分)、越狱安全分(红队安全基准的平均分)与篡改安全分(开源模型 0 分、闭源模型 100 分)按 0.4 : 0.4 : 0.2 加权合成;失控域不设越狱与篡改分项,直接取该域安全基准的平均后一并纳入。安全分是行为指标,直接用基准测试衡量模型的安全表现(如有害请求拒绝、对齐行为等),不包含能力维度的推断。帕累托前沿的方向为越靠上越好,理想区在右上。
无安全基准数据的模型不在图中显示。
如何使用这张图
页面上的图表支持两组开关和一张可排序数据表。本节说明每个选项的含义和用途。
图 2:图表上方的两组开关——最低能力分、发布时间。交互式示意,与官网页面的开关组外观一致。
最低能力分
按模型的能力水平筛选。能力分为网络攻击、生物风险、化学风险、有害操纵、失控五个领域能力分的平均(0–100),阈值取 35/40/45/50/55 五档。
参数量较小、发布时间较早的模型,其能力分可能远低于前沿水平,即便在安全-开放帕累托前沿上,也不一定被用户青睐。因此,我们有必要提供一个能力门槛的筛选选项,帮助用户聚焦在你所关心的能力档次上。从中可以观察一个更关键的问题:在最强的模型中(≥50、≥55 档分别只剩 22、14 个),还有谁留在前沿上。
阈值并非任意选取,按能力分分布取整划定,可以保证每档有足够的样本,对应模型数约 58/51/36/22/14。
发布时间
按模型发布日期筛选,可选近两年、近一年、近半年,用于观察前沿随时间的移动。只看近半年发布的模型,得到的是当前一代模型的权衡格局;与“全部”对比,可以看出行业整体在向“更开放且更安全”推进还是在向封闭收缩。
切换最低能力分或发布时间时,坐标轴尺度保持不变,未筛选掉的点停留在原位。这样设计是为了让筛选前后的变化可直接比较——哪些点被移出视野、帕累托前沿因此向哪个方向移动,都能直接看出来。
图例、悬停浮窗与数据表
-
图例(图底部)按厂商着色,点击厂商名可隐藏或显示该厂商的全部散点,配合“全选/反选”按钮,可将全图聚焦到任意厂商组合。
-
悬停任意圆点会弹出浮窗,展示该模型的完整画像。第一部分是模型名称与所属厂商。第二部分是其安全分、能力分和开放指数总分。第三部分是开放指数的两个组成部分——AA 开放分(0–18)与模型披露分(0–5)。第四部分是模型披露分五个子维度的逐项得分。
-
图下方的数据表与散点图共用筛选状态:对散点图生效的筛选会同步作用于数据表;数据表本身不支持筛选,但支持按任意列排序(默认为开放指数降序)。表格将披露维度的五个条目逐列列出,便于逐模型核查判定结果。
数据来源
图中数据来自两个来源,更新节奏不同。
AA开放指数数据(当前快照 2026-09-08):AA 未提供开放指数的公开 API,我们通过抓取其模型页内嵌的 flight data 获得全量数据(覆盖 AA 侧 227 个模型),再按平台维护的模型映射表关联到平台模型,映射时对同一模型的不同推理配置(-reasoning / -nothinking / -high 后缀)做模糊匹配处理。
模型披露数据(当前复核时间 2026-09-21):采用 AI 调研加人工复核的方式生产,覆盖 15 个厂商系列共 128 个平台模型——Claude(Anthropic)、GPT(OpenAI)、Gemini(Google DeepMind)、Grok(xAI)、Qwen(阿里 Qwen 系列)、Kimi(月之暗面)、GLM(智谱)、MiniMax、混元(腾讯)、DeepSeek、Llama(Meta)、MiMo(小米)、豆包(字节跳动)、百度,以及其他厂商合集。
两套数据的覆盖范围不同:披露调研覆盖 128 个模型,但帕累托图要求模型同时具备平台安全分与披露数据。同时满足全部条件的当前为 62 个模型,即图 1 的散点全集;128 个模型全部参与本文模型披露分的分析各节统计。
结果分析
以下结果基于 2026-09-21 的数据,依次从分布图对比、披露得分分布、条目通过率、家族格局四个层面展开。
分布图在不同选项下的对比
第一组:最低能力分取“全部”与“≥45”的对比。
图 3:左为能力分“全部”(与图 1 为同一视图),右为能力分“≥45”(36 个模型留在图中)。两图坐标尺度完全一致,点的位置一一对应;悬停圆点或点击底部图例可查看细节。
把能力门槛从“全部”提高到 45 分后,图中模型从 62 个减至 36 个,从中可观察到以下两个现象。
- 第一,前沿右端点明显上移:开放度最高的前沿模型从 GLM 4.5(开放 52.2、安全 41.6)换成 GLM 5(开放 43.5、安全 55.7),开放程度下降但安全度提升。对于被过滤掉的模型来说,它们的安全性较低可能是因为其能力本身尚未触及风险黄线,因而未施加完善的安全措施。更强的新模型安全性已经同步提升,若能保持与 GLM 4.5 同等水平的开放度,就可以将前沿向右上方扩张。
- 第二,前沿左段保持稳定:安全分最高(85.8)的 Claude Opus 4.8 能力分高达 62.3,安全分紧随其后(85.4)的 Claude Sonnet 4.5 能力分也有 48.2,提高门槛对头部闭源模型毫无影响——最强的安全水平并不需要以低能力为代价。
第二组:发布时间取“全部”与“近半年”的对比。
图 4:左为发布时间“全部”,右为“近半年”(12 个模型留在图中)。两图坐标尺度一致;“近半年”以页面访问日期为基准滚动计算,模型数会随后续发布缓慢增加。
全集视图(图 4 左)中,前沿从左上(安全分 85 附近)向右下延伸,右端开放度最高的模型安全分只有 41–42——沿边界看,开放度与安全分呈负相关。近半年视图(图 4 右)中剩下 12 个新模型,分布形态没有恶化,新模型的安全分横跨 40–86 区间,前沿右端的安全分约 51,仍高于全集前沿的右端点。换言之,最近半年发布的模型在“开放–安全”权衡上没有后退,右端点反而有所改善;但样本量小,这一观察的稳健性有限。
模型披露分的分析
模型披露分作为本平台对开放指数的创新补充,从中能够获得一些有趣的洞察。
披露得分的整体分布
图 5:128 个模型的披露维度得分分布(满分 5 分,均分 2.01)。交互式图表,数据为 2026-09-21 人工复核快照(图 5/6/7 同),悬停查看每档的模型数与占比。
128 个模型中,5 分 10 个、4 分 14 个、3 分 14 个、2 分 26 个、1 分 57 个、0 分 7 个,均分约 2.01,不到满分的一半。分布的主体聚集在 1–2 分:57 个得 1 分的模型绝大多数仅「能力评估」得 1 分,26 个得 2 分的模型则多为「能力评估 + 安全评估/风险管理」的组合。换言之,一个典型的前沿模型会公开基准分数,但不公开安全评估结果,没有成文的行为规约与风险管理政策,也不公开默认系统提示词。
五个指标的得分率
图 6:五个披露条目各自的通过率(按通过率降序,悬停查看通过数)。
按通过率排序后,各条目在行业中的普及程度差异很大。能力评估(91%)是唯一的“行业惯例”,对应“发布模型即公布基准分数”的通行做法。其余四项的通过率均不足一半。风险管理(41%)与安全评估(38%)处于中间地带,约六成厂商没有成文的模型风险管理政策,而公开安全评估结果的比例与能力评估的 91% 形成超过 50 个百分点的落差。模型规约(19%)与系统提示词(12%)则是明确的少数派实践,成文行为规约目前只有三类(Anthropic Constitution、OpenAI Model Spec、阿里巴巴《模型规约》),公开默认系统提示词的只有 Anthropic、xAI、MiniMax、DeepSeek、Meta 五家的部分模型。
家族格局
图 7:各厂商系列的披露维度平均得分(横条右侧为系列名;红色为均分 ≥4,蓝色为 2.5–4,灰色为 <2.5;虚线为全体均分 2.01;悬停查看模型数)。
-
Anthropic 均分 5.0 居首,且是唯一的全员满分厂商:10 个模型在五个条目上全部得分,依托其完整的披露体系,包括 Constitution、RSP 分级框架、公开的系统提示词文档和逐模型的系统卡。
-
OpenAI 全部 13 个模型稳定在 3–4 分,依靠 Model Spec 与 Preparedness Framework 两份覆盖全家族的文档;失分点同样一致:系统提示词从未公开。
-
Google DeepMind(3.0 分)与 Meta(2.33 分)居第二梯队。Google 的评估披露与 Frontier Safety Framework 齐全,但没有规约类文档,也不公开默认系统提示词。Meta 的 Llama 4 Maverick 拿到 4 分(开放权重家族的天然优势),Llama 3.x 系列则因 Frontier AI Framework 晚于模型发布而停在 2 分。
-
xAI 均分 1.57,但内部分化最大:Grok 4 凭模型卡与公开的默认提示词仓库拿到 4 分,Grok 4.20 凭模型卡与风险管理框架拿到 2 分,老模型只有 1 分。
-
中国厂商整体处于 0.6–2.0 分区间,内部差异不小,也各有亮点:腾讯混元凭成文的模型风险管理研究(《大模型安全与伦理研究报告 2024》等),成为风险管理条目上全员达标的中国厂商;月之暗面(1.4 分)的得分全部来自能力评估条目;阿里闭源线的 qwen3.7-max 是唯一凭《模型规约》拿到模型规约分数的中国模型;DeepSeek、智谱、MiniMax 的头部模型多在 1–3 分。
局限性
- 披露条目是 0/1 判定。 它只反映“是否公开”,不评估披露内容的质量、深度与可复现性。一份数百页的系统卡和一篇简短的安全声明,在条目上同为 1 分。判定规则见附录 A,但个别边界案例仍依赖评审判断(典型案例见附录 B)。
- 开放程度并非越高越好。 本平台开放指数仅衡量模型在各个维度的开放性,并不表明越开放越好的立场。有时候,过度开放可能会让攻击者更容易利用模型的漏洞,增加安全风险。
- 披露维度允许家族共享。 0/1 判定加上部分证据按家族共享,使同一家族的模型在披露分上往往相同,图中表现为若干模型在同一横坐标上竖直排成一列。这是目前评价体系的局限性,不代表这些模型的披露实践完全一致。
- 安全分只覆盖已纳入基准的安全维度。 安全分由当前平台安全基准按固定权重合成,未纳入基准的安全能力不在纵轴内;基准测试到真实世界安全表现之间也存在外推不确定性。
- 仅覆盖部分模型。 披露维度调研覆盖 128 个模型,AA开放指数覆盖 227 个模型,平台能力分和安全分覆盖70个模型,但同时满足全部条件的仅 62 个模型。帕累托前沿图仅显示这 62 个模型,其他模型不在图中。
附录 A:模型披露条目的完整判定规则
以下为模型披露条目的完整判定规则(2026-09-15 版,共六条):
- 系统提示词:官方“建议/强烈推荐/Quick Start 示例”提示词一律判 0,仅官方明示的默认系统提示词算 1。
- 证据优先级:模型专属 > 家族/系统共用。
- 模型规约仅限“模型宪法/价值观/行为规约”类实质成文文档(定义模型行为逻辑、价值偏好与安全边界的规范文档;正面示例:Anthropic Constitution、OpenAI Model Spec、阿里巴巴《模型规约》)。仅披露技术规格(参数量、架构、上下文长度、训练数据量、知识截止等)不计入。排除项:用户使用政策(AUP)/使用条款、安全/风险框架类文件(属风险管理条目)、员工行为准则、泛泛公司级 AI 原则宣传页。时效规则:文档发布时间晚于模型发布时间的,该模型此条目判 0。
- 风险管理衡量“公司有没有针对自己的(前沿)模型制定风险管理的政策”——有成文的模型风险管理政策(含模型风险的识别/评估/缓解管理内容)即给分,不要求政策含前沿风险分级、能力阈值或生物/失控等前沿风险覆盖(Preparedness Framework / Responsible Scaling Policy / Frontier Safety Framework 等水平的分级框架只是充分条件而非必要条件)。仍排除:纯平台基础设施安全方案(模型资产防护/内容审核围栏)、公司战略/ESG 中完全不涉及模型风险管理的内容、联合倡议/口头表态。
- 风险管理的时效与主体规则:① 时效——政策文件须早于模型发布,模型不因未来发布的政策加分;② 相关性——风险管理必须针对特定模型或模型系列,而不是针对云平台或其它下游产品;③ ESG/证券合规披露渠道可计入(只看内容,不看渠道);④ 模型规约条目的“价值观文档”至少须为独立成文文档,模型卡内嵌一句话价值观宣示不算。
- 范围与证据:① 评估范围限主流厂商的前沿模型;② 公司级 AI 原则页不算“价值观文档”;③ 系统提示词条目——官方明示的默认提示词无论 API 还是 web 端 chatbot 渠道均算;④ 未开源模型按闭源模型正常评估;⑤ 证据强度存在争议的条目维持保守判定。
附录 B:典型边界案例
以下案例展示了判定规则如何落实到具体模型上,供后续评审保持一致性:
-
字节跳动 / 火山引擎白皮书(风险管理判 0):《生成式 AI 安全白皮书》由火山引擎(字节旗下 AI 云服务平台)面向平台客户发布,全文未提 Seed/豆包模型线——按相关性规则(附录 A 第 5 条②),14 个模型判 0。
-
阿里《百炼安全白皮书》(部分模型风险管理判 1):《阿里云百炼安全白皮书》第④章“通义大模型全生命周期安全治理”含模型风险管理内容,且阿里云即通义模型线研发主体(与字节情形本质不同);再按时效规则(附录 A 第 5 条①),仅发布于 2025-10-14 之后的模型(qwen3-max-thinking、qwen3.7-max、qwen3.5-plus、qwen3.5-27b)得 1,更早的模型判 0。
-
Meta 模型卡内嵌价值观声明(模型规约判 0):模型卡中一句话价值观宣示不构成“价值观文档”,至少须独立成文文档——6 个 Llama 模型判 0。
-
阿里《模型规约》与 Qwen 开源线(模型规约判 0):《模型规约》(2026-04)晚于 Qwen 开源线全部 17 个模型的发布,按时效规则全部判 0;仅晚于文档发布的 qwen3.7-max 得 1。
-
MiniMax ESG/招股书(部分模型风险管理判 1):ESG/证券合规披露渠道可计入(只看内容,不看渠道);再按时效规则,仅 m2.7(晚于招股书 2025-12-31)与 m3 判 1。
-
月之暗面“good default”措辞(系统提示词判 0):K2 模型卡 Chat Completion 示例中的 system 消息附注 “the system prompt is a good default”,与 “recommended temperature” 并列,属面向部署者的建议性措辞,官方未明示其线上产品真实使用该提示词——区别于 DeepSeek 模型卡 “In the official DeepSeek web/app, we use the same system prompt” 的真实使用明示(判 1)。
-
百度千帆白皮书(风险管理判 0):《千帆大模型平台安全白皮书》为平台基础设施安全+内容合规方案,其中“模型安全”指模型资产加密防窃取,无模型风险管理内容,按第 4 条口径不达标。