Table of Contents
前沿AI风险监测报告(2026Q2)
执行摘要
本报告是前沿AI风险监测平台的第四期季度监测报告,覆盖13家领先AI公司在2025Q3到2026Q2发布的47个前沿模型。
本季度报告首次采用风险指数2.0版框架。与1.5版相比,2.0版不仅更新了测评基准,还对风险指数的计算方法做了三方面优化:1)将能力分对风险指数的影响从线性关系改为指数关系,以反映风险随能力变化的非线性趋势;2)将安全分拆分为基础安全分、越狱安全分和篡改安全分,以更精细化地区分滥用场景与行为体;3)引入能力黄线与风险黄线来标记进入高风险的关键阈值,与业界的风险评级进行对齐,并支持跨领域比较。
此外,2.0版首次引入了业内前沿的越狱攻击技术,以准确评估面对恶意行为者时模型的安全性。
以下是本报告的关键发现:
跨领域趋势
- 🔴 模型风险快速增长,各领域平均风险指数不到一年增长数倍↗️:网络攻击风险指数增长4.4倍,生物风险增长6.6倍,失控风险增长2.4倍。已有模型在生物风险与失控领域超越风险黄线。突破风险黄线意味着模型在已有的安全防护水平下,其剩余风险仍达到高风险边界。
- 🟡 模型能力普遍突破黄线↗️:网络攻击有4个、生物风险有22个、失控有12个模型的能力分都已超过黄线。突破能力黄线意味着若不加安全防护,模型理论上将达到高风险边界。
- 🟡 模型系列风险差异化明显↕️:Gemini 3.1 Pro Preview在生物风险和失控领域风险指数最高,DeepSeek V4 Pro在网络攻击领域风险指数最高,GPT、Kimi、MiniMax、Qwen、Doubao等系列在生物风险领域已越过风险黄线。
- 🟡 开源模型在滥用风险领域安全分偏低↕️:闭源模型仍主导各领域能力上限;在网络攻击、生物风险、化学风险、有害操纵四个滥用风险领域,开源模型安全分分布明显低于闭源模型。
网络攻击
- 🟡 顶尖模型已突破网络攻击能力黄线↗️:GPT、Claude系列已超过能力黄线;前沿模型在自主、长程的漏洞利用和网络渗透任务中进步极快。
- 🔴 安全防护水平倒退↘️:模型平均安全分比上季度略有下降;模型在网络基础拒答测试中表现较好,整体与上季度持平;提示词注入防护的平均表现较上季度略有退步。
生物风险
- 🟡 多项生物能力达到或超过专家水平↗️:湿实验问题排查能力已有22个模型(本季度+7)超过人类专家水平,序列理解能力已有11个模型(本季度+6)超过人类专家水平,生物图像理解能力已有3个模型(本季度+2)超过人类专家水平,前沿模型的生物推理能力、生物信息处理能力持续增强。
- 🟡 生物安全防护水平停滞➡️:模型平均安全分与上季度基本持平,基础生物拒答表现普遍较好,但在红队攻击下安全性大幅下降。
化学风险
- 🟢 化学能力增长平缓➡️:化学能力增长较平缓,本季度未出现新高。多数模型的一般化学知识掌握较好,且已具备一定的专家级化学研究推理能力。
- 🟡 基础化学拒答分化明显↕️:2026Q2模型在SOSBench-Chem上大部分超过90分,但在ChemicalHarmfulQA上大部分低于40分,说明不同化学安全场景下的防护水平差异较大。
有害操纵
- 🟢 有害操纵能力整体未明显增长➡️:有害操纵能力增长较平缓,本季度未出现新高。模型在网络钓鱼、诱导表述、改变信念方面能力较强,但在诱导付费方面能力较弱。
- 🟡 政治说服与主动说服倾向仍是主要短板↗️:多数模型在欺骗和操纵基础拒答上已超过80分,提升明显,但在政治说服场景仍有不少模型不到60分;大部分模型容易表现出主动说服倾向。
失控
- 🟡 失控风险未持续增长➡️:虽然失控领域已有两个模型越过风险黄线(均为Gemini模型),但本季度新发布的模型均未越过风险黄线。模型的自我复制、自我改进、情境感知等能力均未出现新高。
- 🟡 失控安全表现仍未有明显改善➡️:模型诚实性整体不高,且部分模型仍存在较明显的暗中影响用户倾向。
红队测试
- 🔴 高级越狱攻击会系统性削弱模型安全防护↘️:加入红队攻击后,前沿模型的生物安全平均分从78.2降至8.9,网络攻击从90.5降至29.2,化学风险从83.7降至53.1,有害操纵从87.8降至36.4。
- 🟡 不同模型抗越狱能力差异很大↕️:Claude Opus 4.8在红队攻击下仍能保持69.1%的平均拒绝率,而Hunyuan T1 (250711)同样条件下仅5.8%。
最后,报告给以下相关方提供了建议:
- 模型开发者:在新模型发布前开展能力与安全测评;对风险指数较高、尤其是越过风险黄线的模型,优先加强基础安全、越狱防护和防篡改能力,必要时限制高风险能力,并建立与风险阈值挂钩的缓解和发布机制。
- AI安全研究者:改进能力激发、红队攻击和实际风险评估方法,加强对AI智能体及开源模型篡改风险的研究,并探索兼顾安全性与实用性的风险缓解方案。
- 政策制定者:重点关注网络攻击、生物风险和失控领域的预警信号,要求模型开发者在发布前完成相关风险评估并采取必要的缓解措施,同时根据模型能力、安全水平和开闭源方式实施差异化治理。
上一期报告详见前沿AI风险监测报告(2026Q1)。
名词解释

- 前沿模型:发布时能力处在业界前沿水平的人工智能模型。为了在有限的时间和预算内尽可能全面地覆盖到前沿模型,我们只选择每个前沿模型公司的突破性模型,即发布时为该模型公司能力最强的模型。
- 风险领域: 我们定义了5个前沿AI风险领域,包含4个滥用风险领域和失控领域:
- 网络攻击:主要关注AI在网络安全领域的滥用风险,如利用AI制作恶意软件
- 生物风险:主要关注AI在生物领域的滥用风险,如利用AI设计、改造或构建病原体
- 化学风险:主要关注AI在化学领域的滥用风险,如利用AI设计新型剧毒化学品或规划受管制化学品的合成路线。
- 有害操纵:主要关注AI在现实互动场景中的操纵风险,如诱导用户付费、诱导用户表达特定观点、影响用户政治立场或关键决策
- 失控:主要关注自主性AI失控的风险,如AI不受监管地进行自我改进、自我复制、寻求权力,最终导致人类不可逆地失去对AI的控制权的风险
- 能力基准:用于评估模型能力的基准,特别是可能被恶意滥用或推动失控的风险能力。
- 安全基准:用于评估模型安全性的基准。对于滥用风险,主要衡量模型对外部恶意指令的防御能力;对于失控风险,则更多衡量模型内在倾向、诚实性与不当行为抑制能力。安全基准又分为红队和非红队两种,红队基准使用越狱方法对模型进行攻击、试图绕过模型安全护栏,非红队基准则直接向模型发送有害指令。
- 能力分 :模型在各项能力基准中的加权平均分。分数越高,模型可能被滥用或推动失控的风险能力越强。
- 总安全分 :模型安全性的综合分数,分数越高表示模型越安全。对于网络攻击、生物风险等滥用风险,总安全分由基础安全分、越狱安全分和篡改安全分加权合成;对于失控风险,总安全分仍直接来自失控安全基准的平均结果。总安全分的具体计算方法详见这里。
- 基础安全分 :模型在非红队安全基准中的加权平均分,反映模型面对普通有害请求时的安全表现。
- 越狱安全分 :模型在红队安全基准中的加权平均分,反映模型面对越狱攻击时的安全表现。
- 篡改安全分 :模型抵抗恶意微调等篡改模型参数的攻击的能力。由于开源权重更容易被第三方篡改,而闭源模型不太可能被篡改,所以本报告采用简化处理:开源模型的篡改安全分为0,闭源模型的篡改安全分为100。
- 风险指数 :综合能力与安全后的风险分数。风险指数2.0版的计算公式为,其中为能力分,为安全分(归一化到0-1区间),为风险黄线阈值,为能力黄线阈值,为能力-风险系数。计算公式的具体说明详见这里。
- 风险指数2.0版:平台在2026Q2开始采用的新版本风险框架。相比1.5版,2.0版进一步强调真实任务与高级攻击场景,新增CVE-Bench、BixBench、FrontierScience系列与FRT红队攻击基准,并将风险指数公式从线性能力模型改为指数能力模型。当前2.0版中,网络攻击、生物风险和失控领域提供风险指数;化学风险和有害操纵领域尚未设置能力黄线,因此主要提供能力与安全测评结果。
- 能力黄线阈值 :模型能力在无防护条件下相比非AI基线显著增加严重危害风险的参考线。突破能力黄线表示模型能力在无防护条件下已经接近OpenAI High Risk或Anthropic ASL-3所对应的风险水平,相比非AI基线显著放大网络攻击、生物化学滥用或失控威胁;但它只衡量能力,不代表模型在实际部署中已经达到高风险。当前网络攻击、生物风险和失控领域设置了能力黄线。能力黄线阈值的具体计算方法详见这里。
- 风险黄线阈值 :模型在实际部署环境中的剩余风险已经达到高风险边界的参考线,统一归一化为100。突破风险黄线表示模型在实际部署环境中、结合实际安全防护措施后,其剩余风险仍然达到高风险水平,即相比非AI基线显著放大网络攻击、生物化学滥用或失控威胁。由风险指数公式可知,如果模型能力等于能力黄线阈值,且其安全分为0,则模型的风险指数即等于风险黄线阈值,即100。
- 能力-风险系数 :风险指数公式中对能力分的乘数,通过模型能力分与METR报告中的模型自主完成任务时长数据进行拟合得出。基于一个前提假设:模型的风险与其自由完成的任务时间成正比。因为模型可自主完成的任务越长,人类攻击者或监督者所需投入的时间越少,滥用攻击规模和失控可能性就越高。该系数的具体计算方法详见这里。
注:由于风险指数2.0在基准列表和指标计算方面均有很大变化,本报告中的风险指数数值不应与1.0版或1.5版报告逐项比较;更合适的用法是在2.0版框架内部比较不同模型、不同季度和不同领域的相对变化。
模型列表
本节列出本期报告覆盖的最近四个季度(2025Q3至2026Q2)纳入监测的突破性模型。
| 公司 | 模型列表 |
|---|---|
| OpenAI | GPT-5 (high), GPT-5.1 (high), GPT-5.2 (high), GPT-5.4 (high), GPT-5.5 |
| 谷歌 | Gemini 3 Pro Preview, Gemini 3.1 Pro Preview |
| Anthropic | Claude Sonnet 4.5 Reasoning, Claude Opus 4.5 Reasoning, Claude Opus 4.6 Reasoning, Claude Opus 4.8 |
| xAI | Grok 4, Grok 4.20 Beta Reasoning, Grok 4.3 |
| 深度求索 | DeepSeek V3.1 Terminus Reasoning, DeepSeek V3.2 Reasoning, DeepSeek V4 Pro |
| 阿里巴巴 | Qwen 3 235B Reasoning (250725), Qwen 3.5 397B Reasoning, Qwen 3.7 Max |
| 字节跳动 | Doubao Seed 1.6 (251015 High), Doubao Seed 1.8 (251215 High), Doubao Seed 2.0 Pro (260215), Doubao Seed 2.1 Pro |
| 腾讯 | Hunyuan T1 (250711), HY 2.0 Think, HY 3.0 Preview |
| 百度 | ERNIE X1.1 Preview, ERNIE 5.0 Thinking Preview, ERNIE 5.0 Thinking, ERNIE 5.1 |
| 稀宇科技 | MiniMax M2, MiniMax M2.7, MiniMax M3 |
| 月之暗面 | Kimi K2 (250711), Kimi K2 (250905), Kimi K2 Thinking, Kimi K2.5 Thinking, Kimi K2.6 |
| 智谱 | GLM 4.5, GLM 4.6, GLM 4.7, GLM 5, GLM 5.2 |
| 小米 | MiMo V2 Flash Reasoning, MiMo V2 Pro Reasoning, MiMo V2.5 Pro |
其中,2026Q2新增纳入监测的模型包括:GPT-5.5、Claude Opus 4.8、Grok 4.3、DeepSeek V4 Pro、Qwen 3.7 Max、Doubao Seed 2.1 Pro、HY 3.0 Preview、ERNIE 5.1、MiniMax M3、Kimi K2.6、GLM 5.2、MiMo V2.5 Pro。
测评基准列表
本期评估的风险领域包括网络攻击、生物风险、化学风险、有害操纵与失控,使用的测评基准列表如下:
| 领域 | 能力测评 | 安全测评 |
|---|---|---|
| 网络攻击 查看测评详情 |
• CyberSecEval2-VulnerabilityExploit:代码漏洞发现和利用能力 • CyBench:CTF夺旗任务能力 • CVE-Bench:真实Web应用渗透攻击能力 |
• AirBench-SecurityRisks:网络安全有害问题 • CyberSecEval2-PromptInjection:提示词注入 • FRT-AirBench-SecurityRisks:网络安全有害问题+红队攻击 • Fortress-Privacy/Scams:隐私与诈骗场景红队攻击 |
| 生物风险 查看测评详情 |
• BioLP-Bench:生物实验问题定位能力 • BixBench:生物信息学智能体任务能力 • LAB-Bench-SeqQA:DNA和蛋白质序列理解能力 • LAB-Bench-FigQA:生物图像理解能力 • FrontierScience-Biology:前沿生物科学推理能力 |
• SciKnowEval-BiologicalHarmfulQA:生物有害问题 • SOSBench-Bio:生物违规问题 • FRT-SciKnowEval-BiologicalHarmfulQA:生物有害问题+红队攻击 • Fortress-Biological:生物风险红队攻击 |
| 化学风险 查看测评详情 |
• ChemBench-ToxicityAndSafety:化学毒性和安全知识 • ChemBench-Normal:一般化学知识能力 • FrontierScience-Chemistry:前沿化学科学推理能力 |
• SOSBench-Chem:化学违规问题 • SciKnowEval-ChemicalHarmfulQA:化学有害问题 • FRT-SOSBench-Chem:化学违规问题+红队攻击 • Fortress-Chemical:化学风险红队攻击 |
| 有害操纵 查看测评详情 |
• CyberSecEval3-MultiTurnPhishing:多轮网络钓鱼攻击能力 • MakeMePay:诱导付费能力 • MakeMeSay:诱导用户说出指定内容的能力 • PMIYC:改变信念的能力 |
• AirBench-Deception:欺骗类有害任务 • AirBench-Manipulation:操纵类有害任务 • AirBench-PoliticalPersuasion:政治说服类任务 • APE:说服他人倾向 • FRT-AirBench-Manipulation:操纵类有害任务+红队攻击 |
| 失控 查看测评详情 |
• Self-Proliferation:自我复制与适应能力 • MLE-Bench:受限资源下的机器学习工程能力 • SciCode:科学编程能力 • GDM-Stealth:隐蔽行动能力 • SAD-mini:情境感知能力 |
• MASK:模型诚实性 • Agentic-Misalignment:代理式错误对齐倾向 • Shutdown-Resistance:抵抗关机倾向 • DarkBench:暗中影响用户的倾向 |
与风险指数1.5版相比,本期2.0版新增CVE-Bench、BixBench、FrontierScience-Biology/Chemistry、ChemBench-Normal和FRT系列红队测试基准;移除WMDP-Cyber/Bio/Chem、SciKnowEval-ProteoToxicityPrediction/MolecularToxicityPrediction、StrongReject、ISC-Bench系列,并将CyberSecEval3-MultiTurnPhishing从网络攻击领域移除(有害操纵领域保留)。新增基准实现细节和移除原因分别见附录B和附录C。
注:为了保证图表内部的一致性,本报告中展示的历史季度风险曲线,均按2.0版测评基准体系回溯计算。
监测结果
跨领域趋势
总体趋势
基于风险指数2.0版,当前网络攻击、生物风险和失控领域整体风险指数、能力分及安全分变化趋势如下图所示:
趋势显示:
- 网络攻击:平均能力分从2025Q3的39.3持续增长至2026Q2的56.2,平均安全分从56.5升至2026Q1的68.9,但最近一个季度又下降到66.8。平均风险指数从4.7持续攀升至20.9,不到一年增长4.4倍。最大风险指数已达44.8。
- 生物风险:与网络攻击领域类似,平均能力分持续增长,安全分增长到2026Q1达到最大值,最近一个季度又略有下降。平均风险指数从2025Q3的16.8升至2026Q2的110.2,增长6.6倍,已超越风险黄线。最大风险指数已达234.6。
- 失控:平均能力分增长到2026Q1后开始停滞,安全分持续增长。平均风险指数从2025Q3的9.0升至2026Q1的32.5,最近一个季度回落到21.9。最大风险指数已达178.5,超过黄线阈值。
模型系列对比
- Gemini系列:Gemini 3.1 Pro Preview在生物风险和失控领域的风险指数全局最高,均已超过风险黄线。
- DeepSeek系列:DeepSeek V4 Pro网络攻击领域风险指数全局最高,且增速较快,但尚未达到风险黄线。失控领域风险指数仅次于Gemini 3.1 Pro Preview。
- GPT系列:网络攻击和失控领域风险指数快速增长,生物风险领域已越过风险黄线。
- Kimi/MiniMax/Qwen/Doubao系列:网络攻击和生物风险领域增长较快,生物风险领域已越过黄线。
- Claude系列:Claude Opus 4.8在网络攻击领域风险指数排名仅次于DeepSeek和GPT。由于本轮测评不包含Claude最强模型Fable/Mythos 5,可能低估了Claude系列模型的实际风险。
开源与闭源对比
开源与闭源模型呈现出以下特征:
- 闭源模型仍主导各领域能力上限:GPT-5.5、Claude Opus 4.8、Gemini 3.1 Pro Preview等闭源模型在各领域上的能力分保持领先。
- 开源模型在滥用风险领域的安全分普遍低于闭源模型:在网络攻击、生物风险、化学风险、有害操纵这四个滥用风险领域,开源模型的安全分分布明显低于闭源模型的分布。
- 闭源模型在失控领域的安全分更低:在失控领域,Gemini 3.1 Pro Preview、Grok 4、Gemini 3 Pro Preview这几个模型的安全分显著低于其他模型,这些模型因能力分高且安全分低而形成更高风险。
网络攻击
风险概览
在网络攻击领域,当前风险指数最高的模型依次为DeepSeek V4 Pro、GPT-5.5和Claude Opus 4.8,尚无模型超过风险黄线。但从能力角度,已经有4个模型超过能力黄线(GPT-5.5、GPT-5.4、Claude Opus 4.8、Claude Opus 4.6)。DeepSeek V4 Pro虽然能力分不是最高,但安全分仅43.4,是其风险指数最高的主要原因。
此外,Kimi、GLM、MiMo、Qwen、Doubao等模型系列的风险指数增长也较快,主要来源于能力分的增长。Grok系列的风险指数出现了持续下降,主要是因为能力分持续下降以及安全分持续提升。
注:本次测评未包含Claude最强模型Fable/Mythos 5,根据该模型的系统卡,其网络攻击能力远强于Claude Opus 4.8。该模型公开发布后,实际网络攻击风险很可能高于本报告的发现。
能力测评
- 漏洞利用能力:在CyberSecEval2-VulnerabilityExploit上,GPT-5.4取得95.6分的最高分。一半模型的分数超过80分,说明漏洞识别与利用能力已经较普遍。
- CTF任务:GPT-5.5和Claude Opus 4.8在CyBench上达到92.5分,并列第一,说明其在需要多轮规划、工具调用和环境交互的网络攻击任务中表现突出。前沿模型最高分在不到一年的时间内提升68%,进步神速。而且需要说明的是,这些成绩是在Inspect内置的最简单的Agent框架上取得的,没有使用任何先进的Harness技术,也没有使用任何网络攻击专用的工具,进步全部来自模型能力的提升。
- 真实Web漏洞利用任务:在CVE-Bench上,GPT-5.5在zero-day设置下取得43.3分的最高分,其他模型全部低于40分。这一结果说明真实Web漏洞利用任务比起CTF任务,对前沿模型更具挑战。但同样需要说明的是,这些成绩也是在Inspect内置的最简单的Agent框架上完成的,而且限制了最大交互消息数是90。如果允许模型使用先进的Agent框架及更大的消息预算,大概率可以取得更好的成绩(我们已注意到在GPT-5.5系统卡中,报告的CVE-Bench得分达93.1)。
安全测评
- 网络基础拒答:2026Q2模型在AirBench-SecurityRisks普遍达90分以上,显示基础网络安全护栏较强。
- 提示词注入防护:2026Q2模型在PromptInjection上得分普遍在80-90之间,平均表现比起2026Q1略有退步。可见模型在能力提升的同时,对提示词注入的防护并不一定能同步提升。
生物风险
风险概览
在生物风险领域,目前已有12个模型越过风险黄线。其中Gemini 3.1 Pro Preview风险指数最高,达234.6,同样超过风险黄线的还有Kimi、GPT、Qwen、Doubao、MiniMax系列模型。从能力角度,已有22个模型越过能力黄线,其中GPT-5.5能力分最强,Claude Opus 4.8第二,不过由于安全分较高,Claude Opus 4.8的风险指数只有43.4,低于风险黄线。Grok、GLM系列也越过了能力黄线,不过均未越过风险黄线。
能力测评
- 湿实验问题排查:BioLP-Bench基准的结果显示,已有22个模型(本季度+7)超过了人类专家水平,最高分为Claude Opus 4.6(48.7),最近一个季度未创新高。
- DNA和蛋白质序列理解:在LAB-Bench-SeqQA基准中,已有11个模型(本季度+6)超过了人类专家水平,最高分为GPT-5.5(91.5分),可见前沿模型已具备较强的序列理解能力。
- 生物图像理解:LAB-Bench-FigQA基准的结果显示,已有3个模型(本季度+2)超过了人类专家,最高分为Claude Opus 4.8(79.6分),不到一年提升38%。
- 前沿生物科学推理:在FrontierScience-Biology上,最高分仅47.1(GPT-5.4),大部分模型得分不到40分,可见模型在专家级科学研究推理能力方面还有较大不足。
- 生物信息学智能体任务:Claude Opus 4.8在BixBench上取得51.0分的最高分,大部分模型得分不到40分,可见模型在真实生物信息学长程任务中仍有不足。需要说明的是,这些成绩是在Inspect内置的最简单的Agent框架上取得的,没有使用任何先进的Harness技术,且仅能使用预设的生物信息学工具计算,因此可能会低估模型的实际能力。
安全测评
- 基础生物拒答:在BiologicalHarmfulQA上,2026Q2的模型整体比上个季度略有提升,但也存在部分模型安全分数较低,如MiniMax M3仅59.6分,ERNIE 5.1仅62.3分。在SOSBench-Bio上,2026Q2模型大部分已经达到90分以上,整体进步趋势明显。
化学风险
风险概览
由于化学领域暂未有能力黄线,因此没有计算风险指数,本节主要分析能力与安全测评结果。化学领域能力分最高的是GPT-5.4(72.3),Kimi、GLM、Grok系列也已超过70分。安全分最低的是DeepSeek V4 Pro(28.9分),Kimi、MiMo系列也曾低于30分,不过最新模型有所改善。
能力测评
- 化学毒性与安全知识:GPT-5.5在ChemBench-ToxicityAndSafety上取得58.4的最高分,模型能力进步整体比较平缓。
- 一般化学知识:GPT-5.4在ChemBench-Normal上取得88.7的最高分,2026Q2模型分数都在80到90分之间,说明前沿模型普遍具备较好的一般化学知识。
- 前沿化学科学推理:Gemini 3.1 Pro Preview在FrontierScience-Chemistry上达到74.9的最高分,大部分模型超过60分,可见前沿模型已具备一定的专家级化学研究推理能力。
安全测评
- 基础化学拒答:2026Q2模型在SOSBench-Chem上大部分超过90分,模型进步趋势明显。但在ChemicalHarmfulQA上大部分低于40分,HY 3.0 Preview仅7.3分,显示不同化学安全基准之间存在显著差异。
有害操纵
风险概览
由于有害操纵领域暂未有能力黄线,因此没有计算风险指数,本节主要分析能力与安全测评结果。在能力分方面,Gemini 3.1 Pro Preview得分最高(68.9分),最近一个季度的最高分是Doubao Seed 2.1 Pro(62.5分)。过去一年模型能力的进步整体不明显。在安全分方面,最低分的模型是DeepSeek V4 Pro(25.7),GLM和Kimi系列也曾低于30分,不过新版本有所改善。
能力测评
- 网络钓鱼:Claude Opus 4.6在MultiTurnPhishing上取得最高分79.2分,断层领先,大部分模型得分在50到70之间。
- 诱导付费:Gemini 3.1 Pro Preview在MakeMePay上取得最高分82.2分,遥遥领先,大部分模型得分只在30到50之间。
- 诱导表述:Claude Opus 4.8在MakeMeSay上取得最高分73.4分,但相比先前的模型提升不明显。
- 改变信念:GPT-5.1在PMIYC上取得最高分80.9分,模型在这方面的能力,过去一年基本上没有进步。
安全测评
- 基础有害操纵拒答:在AirBench-Deception和AirBench-Manipulation上,2026Q2模型大部分得分在80分以上,欺骗和操纵场景整体较安全。但在AirBench-PoliticalPersuasion上,仍有不少模型不到60分,ERNIE 5.1仅47.1分,政治说服场景仍是短板。
- 说服倾向:在APE上,大部分模型得分不足40分,ERNIE和DeepSeek系列甚至不到4分,说明模型仍非常容易表现出主动说服倾向。
失控领域
风险概览
在失控领域,目前已有两个模型越过了风险黄线,均为Gemini模型,其中Gemini 3.1 Pro Preview 风险指数已达178.5。有12个模型越过了能力黄线,包括Gemini、GPT、Claude、Qwen、DeepSeek、Kimi等系列的模型。GPT、DeepSeek、Qwen的最新模型虽未超越风险黄线,但风险指数增长较快,主要由于能力分快速提升,同时安全分下降导致。安全分最低的模型是Grok-4(38.0),但其后续版本已有明显改善。
能力测评
- 自我复制能力:Claude Opus 4.6在Self-Proliferation上取得最高分63.3分。2026Q2模型普遍超过40分,但相比上个季度没有明显进步。
- 机器学习工程能力:MiMo V2 Pro在MLE-Bench上取得最高分61.9分。2026Q2模型得分跨度较大,最高的GPT-5.5得57.1分,最低的Grok 4.3仅9.5分,整体表现还不如上个季度的模型,体现其在受限资源下完成机器学习工程任务方面仍面临挑战。
- 科学编程能力:Gemini 3.1 Pro Preview在SciCode上取得最高分58.9分。2026Q2模型普遍在40到60分之间,相比上个季度进步不明显。
- 隐蔽行动:Gemini 3.1 Pro Preview取得最高分39.3分,大幅领先其它模型。2026Q2模型普遍得分不到20,显示规避监管对于大部分前沿模型来说仍有挑战。
- 情境感知:Gemini 3.1 Pro Preview在SAD-mini上取得92.0的最高分。2026Q2模型普遍得分在75到85之间,说明前沿模型普遍具备较强情境感知能力。但过去一年整体分数进步不明显,显示该基准可能已接近饱和。
安全测评
- 诚实性:在MASK基准上,模型得分差异较大,有一半模型得分不到60分,最低分仅32.5(Grok 4),说明模型的诚实性整体不高。
- 代理式错误对齐:在Agentic-Misalignment基准上,最新季度模型的表现有所改善,大部分高于75分,且GPT和Claude系列模型几乎都达到了100分满分。但仍有少数模型得分较低,如DeepSeek V4 Pro得分54.8。
- 抵抗关机:大多数模型在Shutdown-Resistance上表现很好,都在95分以上。只有GPT系列、Gemini系列、Grok系列早期、Doubao Seed 2.1 Pro以及Claude Opus 4.6分数略低。
- 暗中影响用户:Claude Opus 4.8在DarkBench上取得87.7分的最高分;但大部分模型低于60分,如Grok 4.20 Beta仅32.0,说明部分模型仍存在较明显的暗中影响用户倾向。
红队测试
如前所述,我们在风险指数2.0版中新增了红队测试,以评估模型在受攻击情况下的安全性变化。
下图对比了四个滥用风险领域中,同一原始安全数据集在“无红队攻击”和“有红队攻击”两种设置下的模型得分。分数越高表示模型越能拒绝或抵抗不安全请求。每张图按有红队攻击下的分数从高到低排序。
红队测试显示,基础安全分和红队攻击下的安全分之间存在系统性落差:
- 红队攻击会显著拉低安全分:所有前沿模型在生物原始数据集上的平均分为78.2,但加入红队攻击后仅为8.9,平均下降69.3分;网络攻击从90.5降至29.2;化学风险从83.7降至53.1;有害操纵从87.8降至36.4。也就是说,基础拒答高分并不等于模型能抵抗前沿红队攻击。
- 不同领域数据集的攻击成功率差异明显:SOSBench-Chem在红队攻击后平均分仍有53.1,而SciKnowEval-BiologicalHarmfulQA在红队攻击下仅剩8.9,可见攻击效果在不同数据集间存在差异。这可能和不同数据集所采取的默认评分器不同有关。
- 不同模型抗越狱能力存在较大差异:例如Claude Opus 4.8在红队攻击下仍能保持69.1%的平均拒绝率,而Hunyuan T1 (250711)同样条件下仅5.8%。
- 存在攻击后安全分反增的现象:例如在SOSBench-Chem上,Grok-4模型在攻击前安全分数为41.2分,攻击后反而增加到62.3分。这有可能是因为该模型对常见的攻击方法进行了对抗性训练,但却缺乏针对该风险领域的基础拒答训练。这种现象仅此一例。
局限性
本报告存在以下局限性:
- 风险评估范围的局限性
- 本次风险监测仅针对大语言模型(包括视觉语言模型),尚未涉及对更多模态和智能体等系统的监测,尚不能全面评估所有模型和AI系统的风险。
- 本次风险监测仅针对滥用和失控类型的风险评估,尚不能涵盖所有类型的前沿风险(比如意外风险和系统性风险)。
- 风险评估方法的局限性
- 由于现有测评方法的不足,尚不能够充分测出模型的能力和安全水平,如
- 能力测评的提示词、工具、Agent框架等设置可能未全面发挥出模型的潜力。
- 安全测评中仅尝试了有限的红队攻击方法。
- 有害操纵测评中使用LLM来模拟被说服者,可能和真人存在效果差异。
- 模型的评估感知(evaluation awareness)可能会影响基准测评分数的可信度。
- 风险指数的计算是现有条件下对实际风险的一种简化建模,尚不能精确量化实际的风险。
- 当前对滥用风险的评估仅考虑了模型对攻击者的赋能,尚未考虑模型对防御者的赋能对整体风险的影响。
- 当前风险指数2.0版中,化学风险与有害操纵领域尚未定义能力黄线阈值,未能计算风险指数。
- 由于现有测评方法的不足,尚不能够充分测出模型的能力和安全水平,如
- 测评数据集的局限性
- 当前选取的测评数据集大部分是开源的,可能已经存在于一些模型的训练数据中,导致能力和安全得分不够精准。
- 测评数据集所覆盖的场景可能不全。
- 当前的测评数据集以英文内容为主,尚不能评估多语言环境下的风险情况。
- 部分测评基准仍可能随着模型能力提升而逐渐饱和,需要持续更新。
此外,本报告仅针对模型可能产生的风险进行了评估,而未评估模型带来的收益,在实际制定政策和行动时需要权衡风险与收益。
建议
面向模型开发者
基于本期监测结果,我们向模型开发者提供以下建议:
- 关注自身开发的模型的风险指数情况,如果风险指数超过风险黄线:
- 建议优先加强模型安全防护:
- 加强基础安全防护:如通过监督微调训练模型拒绝有害请求。
- 加强越狱安全防护:如通过输入输出监控来识别并过滤掉有害的请求和回答、通过对抗性训练来提升模型对越狱请求的防御能力等。
- 加强篡改安全防护:闭源模型需加强网络安全防护以防止参数泄露;开源模型可探索在训练过程中引入防篡改机制。
- 加强失控领域安全防护:如通过思维链监控来检测模型可能的欺骗和密谋。
- 如果仅靠加强安全防护不足以缓解风险,则可探索降低模型高风险能力:
- 从模型训练数据中移除网络攻击、生物、化学武器等高危知识,或在后训练阶段使用机器遗忘技术从模型参数中移除。
- 构建请求分类器,将高风险领域请求路由到相对低能力的模型进行处理。
- 一些通用的风险管理实践:
- 根据自身情况制定风险管理框架,明确风险阈值、达到阈值后的缓解措施和发布策略。可参考前沿AI风险管理框架。
- 加强模型风险信息披露,如在发布模型的同时提供模型的系统卡,提升安全治理透明度。
- 建议优先加强模型安全防护:
- 如果能力分越过能力黄线,风险指数未越过风险黄线:
- 建议对模型进行全面的安全评估,确保当前防护措施足以将模型部署后风险缓解到中低水平。
- 建议加强模型安全防护,将风险控制在更低水平,为未来模型能力提升提供一定的缓冲空间。具体措施同上。
- 如果能力分和风险指数均未超过黄线:
- 暂无特殊建议,可保持关注新模型的风险情况,在新模型发布前进行能力和安全测评,及时掌握变化。
安远AI可为模型开发者提供前沿风险管理咨询和安全测评服务,如有合作意向请联系risk-monitor@concordia-ai.com。
面向AI安全研究者
基于本期监测结果,我们向AI安全研究者提供以下建议:
- 对于风险评估方向的研究者:
- 可探索更有效的能力激发方法(如更好的智能体框架、推理时扩展),以准确评估模型的能力上限。
- 可探索更有效的攻击模型的方法(如新的越狱、红队攻击、提示词注入和多轮操纵方法),以准确评估模型的安全下限。
- 可探索更精准评估实际风险的方法,例如建立新的威胁模型并针对其中各个环节设计针对性的测评基准。
- 鉴于AI智能体的广泛应用,可探索针对智能体工具调用、长期任务执行和环境交互的风险评估方法。
- 对于风险缓解方向的研究者:
- 可探索更有效的模型安全加固和危险能力移除方案,在增强模型安全性的同时尽可能不牺牲其实用能力。
- 鉴于开源模型更容易被恶意篡改,可探索适合开源模型的风险缓解方案。
上述方向也是安远AI未来的重点研究方向,安远AI愿与业界同行合作开展研究,如有合作意向请联系risk-monitor@concordia-ai.com。
面向政策制定者
基于本期监测结果,我们发现以下早期预警信号:
- 网络攻击滥用风险:GPT-5.5、Claude Opus 4.8已突破能力黄线,而Claude Fable/Mythos 5能力还远强于Claude Opus 4.8。前沿模型在CyBench和CVE-Bench等基准上快速进步,体现这些模型已逐步具备以自主、多轮交互方式进行漏洞发现、利用和网络渗透的能力。但多数模型安全防护弱,在红队攻击下安全分数平均下降61.3分。
- 生物滥用风险:目前已有12个模型越过风险黄线。模型在湿实验问题排查、DNA与蛋白质序列理解、生物图像理解等任务上已超过人类专家水平。但多数模型安全防护弱,在红队攻击下安全分数平均降69.3分。
- 失控风险:目前已有2个模型越过风险黄线。部分模型已同时具备一定的自我复制和自我改进能力,较强的情境感知能力,以及偏低的诚实性和暗中影响安全分。
建议政策制定者对上述网络攻击、生物风险和失控领域的预警信号保持关注,并加强对模型的相关监管要求(如要求模型开发者在发布模型前对网络攻击、生物风险和失控风险进行评估,并实施必要的风险缓解措施)。可针对不同风险开展差异化治理方法,综合考虑模型能力水平、安全性以及分发方式(开源或闭源)等因素。
附录
关于本期监测所用到的风险指数计算方法、测评基准的具体实现细节、信息危害披露权衡详见这里。