Loading...
加载中...
Table of Contents

前沿AI风险监测报告(2026Q2)

作者: 安远AI团队
发布日期: 2026年7月19日

执行摘要

本报告是前沿AI风险监测平台的第四期季度监测报告,覆盖13家领先AI公司在2025Q3到2026Q2发布的47个前沿模型。

本季度报告首次采用风险指数2.0版框架。与1.5版相比,2.0版不仅更新了测评基准,还对风险指数的计算方法做了三方面优化:1)将能力分对风险指数的影响从线性关系改为指数关系,以反映风险随能力变化的非线性趋势;2)将安全分拆分为基础安全分、越狱安全分和篡改安全分,以更精细化地区分滥用场景与行为体;3)引入能力黄线风险黄线来标记进入高风险的关键阈值,与业界的风险评级进行对齐,并支持跨领域比较。

此外,2.0版首次引入了业内前沿的越狱攻击技术,以准确评估面对恶意行为者时模型的安全性。

以下是本报告的关键发现:

跨领域趋势

  • 🔴 模型风险快速增长,各领域平均风险指数不到一年增长数倍↗️:网络攻击风险指数增长4.4倍,生物风险增长6.6倍,失控风险增长2.4倍。已有模型在生物风险与失控领域超越风险黄线。突破风险黄线意味着模型在已有的安全防护水平下,其剩余风险仍达到高风险边界。
  • 🟡 模型能力普遍突破黄线↗️:网络攻击有4个、生物风险有22个、失控有12个模型的能力分都已超过黄线。突破能力黄线意味着若不加安全防护,模型理论上将达到高风险边界。
  • 🟡 模型系列风险差异化明显↕️:Gemini 3.1 Pro Preview在生物风险和失控领域风险指数最高,DeepSeek V4 Pro在网络攻击领域风险指数最高,GPT、Kimi、MiniMax、Qwen、Doubao等系列在生物风险领域已越过风险黄线。
  • 🟡 开源模型在滥用风险领域安全分偏低↕️:闭源模型仍主导各领域能力上限;在网络攻击、生物风险、化学风险、有害操纵四个滥用风险领域,开源模型安全分分布明显低于闭源模型。

网络攻击

  • 🟡 顶尖模型已突破网络攻击能力黄线↗️:GPT、Claude系列已超过能力黄线;前沿模型在自主、长程的漏洞利用和网络渗透任务中进步极快。
  • 🔴 安全防护水平倒退↘️:模型平均安全分比上季度略有下降;模型在网络基础拒答测试中表现较好,整体与上季度持平;提示词注入防护的平均表现较上季度略有退步。

生物风险

  • 🟡 多项生物能力达到或超过专家水平↗️:湿实验问题排查能力已有22个模型(本季度+7)超过人类专家水平,序列理解能力已有11个模型(本季度+6)超过人类专家水平,生物图像理解能力已有3个模型(本季度+2)超过人类专家水平,前沿模型的生物推理能力、生物信息处理能力持续增强。
  • 🟡 生物安全防护水平停滞➡️:模型平均安全分与上季度基本持平,基础生物拒答表现普遍较好,但在红队攻击下安全性大幅下降。

化学风险

  • 🟢 化学能力增长平缓➡️:化学能力增长较平缓,本季度未出现新高。多数模型的一般化学知识掌握较好,且已具备一定的专家级化学研究推理能力。
  • 🟡 基础化学拒答分化明显↕️:2026Q2模型在SOSBench-Chem上大部分超过90分,但在ChemicalHarmfulQA上大部分低于40分,说明不同化学安全场景下的防护水平差异较大。

有害操纵

  • 🟢 有害操纵能力整体未明显增长➡️:有害操纵能力增长较平缓,本季度未出现新高。模型在网络钓鱼、诱导表述、改变信念方面能力较强,但在诱导付费方面能力较弱。
  • 🟡 政治说服与主动说服倾向仍是主要短板↗️:多数模型在欺骗和操纵基础拒答上已超过80分,提升明显,但在政治说服场景仍有不少模型不到60分;大部分模型容易表现出主动说服倾向。

失控

  • 🟡 失控风险未持续增长➡️:虽然失控领域已有两个模型越过风险黄线(均为Gemini模型),但本季度新发布的模型均未越过风险黄线。模型的自我复制、自我改进、情境感知等能力均未出现新高。
  • 🟡 失控安全表现仍未有明显改善➡️:模型诚实性整体不高,且部分模型仍存在较明显的暗中影响用户倾向。

红队测试

  • 🔴 高级越狱攻击会系统性削弱模型安全防护↘️:加入红队攻击后,前沿模型的生物安全平均分从78.2降至8.9,网络攻击从90.5降至29.2,化学风险从83.7降至53.1,有害操纵从87.8降至36.4。
  • 🟡 不同模型抗越狱能力差异很大↕️:Claude Opus 4.8在红队攻击下仍能保持69.1%的平均拒绝率,而Hunyuan T1 (250711)同样条件下仅5.8%。

最后,报告给以下相关方提供了建议:

  • 模型开发者:在新模型发布前开展能力与安全测评;对风险指数较高、尤其是越过风险黄线的模型,优先加强基础安全、越狱防护和防篡改能力,必要时限制高风险能力,并建立与风险阈值挂钩的缓解和发布机制。
  • AI安全研究者:改进能力激发、红队攻击和实际风险评估方法,加强对AI智能体及开源模型篡改风险的研究,并探索兼顾安全性与实用性的风险缓解方案。
  • 政策制定者:重点关注网络攻击、生物风险和失控领域的预警信号,要求模型开发者在发布前完成相关风险评估并采取必要的缓解措施,同时根据模型能力、安全水平和开闭源方式实施差异化治理。

上一期报告详见前沿AI风险监测报告(2026Q1)

名词解释

Concept

  • 前沿模型:发布时能力处在业界前沿水平的人工智能模型。为了在有限的时间和预算内尽可能全面地覆盖到前沿模型,我们只选择每个前沿模型公司的突破性模型,即发布时为该模型公司能力最强的模型。
  • 风险领域: 我们定义了5个前沿AI风险领域,包含4个滥用风险领域和失控领域:
    • 网络攻击:主要关注AI在网络安全领域的滥用风险,如利用AI制作恶意软件
    • 生物风险:主要关注AI在生物领域的滥用风险,如利用AI设计、改造或构建病原体
    • 化学风险:主要关注AI在化学领域的滥用风险,如利用AI设计新型剧毒化学品或规划受管制化学品的合成路线。
    • 有害操纵:主要关注AI在现实互动场景中的操纵风险,如诱导用户付费、诱导用户表达特定观点、影响用户政治立场或关键决策
    • 失控:主要关注自主性AI失控的风险,如AI不受监管地进行自我改进、自我复制、寻求权力,最终导致人类不可逆地失去对AI的控制权的风险
  • 能力基准:用于评估模型能力的基准,特别是可能被恶意滥用或推动失控的风险能力。
  • 安全基准:用于评估模型安全性的基准。对于滥用风险,主要衡量模型对外部恶意指令的防御能力;对于失控风险,则更多衡量模型内在倾向、诚实性与不当行为抑制能力。安全基准又分为红队和非红队两种,红队基准使用越狱方法对模型进行攻击、试图绕过模型安全护栏,非红队基准则直接向模型发送有害指令。
  • 能力分 CC:模型在各项能力基准中的加权平均分。分数越高,模型可能被滥用或推动失控的风险能力越强。
  • 总安全分 SS:模型安全性的综合分数,分数越高表示模型越安全。对于网络攻击、生物风险等滥用风险,总安全分由基础安全分、越狱安全分和篡改安全分加权合成;对于失控风险,总安全分仍直接来自失控安全基准的平均结果。总安全分的具体计算方法详见这里
    • 基础安全分 S1S_1:模型在非红队安全基准中的加权平均分,反映模型面对普通有害请求时的安全表现。
    • 越狱安全分 S2S_2:模型在红队安全基准中的加权平均分,反映模型面对越狱攻击时的安全表现。
    • 篡改安全分 S3S_3:模型抵抗恶意微调等篡改模型参数的攻击的能力。由于开源权重更容易被第三方篡改,而闭源模型不太可能被篡改,所以本报告采用简化处理:开源模型的篡改安全分为0,闭源模型的篡改安全分为100。
  • 风险指数 RR:综合能力与安全后的风险分数。风险指数2.0版的计算公式为R=R0ea(CC0)×(1S)R = R_0 e^{a (C - C_0)} \times (1 - S),其中CC为能力分,SS为安全分(归一化到0-1区间),R0R_0为风险黄线阈值,C0C_0为能力黄线阈值,aa为能力-风险系数。计算公式的具体说明详见这里
    • 风险指数2.0版:平台在2026Q2开始采用的新版本风险框架。相比1.5版,2.0版进一步强调真实任务与高级攻击场景,新增CVE-Bench、BixBench、FrontierScience系列与FRT红队攻击基准,并将风险指数公式从线性能力模型改为指数能力模型。当前2.0版中,网络攻击、生物风险和失控领域提供风险指数;化学风险和有害操纵领域尚未设置能力黄线,因此主要提供能力与安全测评结果。
    • 能力黄线阈值 C0C_0:模型能力在无防护条件下相比非AI基线显著增加严重危害风险的参考线。突破能力黄线表示模型能力在无防护条件下已经接近OpenAI High RiskAnthropic ASL-3所对应的风险水平,相比非AI基线显著放大网络攻击、生物化学滥用或失控威胁;但它只衡量能力,不代表模型在实际部署中已经达到高风险。当前网络攻击、生物风险和失控领域设置了能力黄线。能力黄线阈值的具体计算方法详见这里
    • 风险黄线阈值 R0R_0:模型在实际部署环境中的剩余风险已经达到高风险边界的参考线,统一归一化为100。突破风险黄线表示模型在实际部署环境中、结合实际安全防护措施后,其剩余风险仍然达到高风险水平,即相比非AI基线显著放大网络攻击、生物化学滥用或失控威胁。由风险指数公式可知,如果模型能力等于能力黄线阈值,且其安全分为0,则模型的风险指数即等于风险黄线阈值,即100。
    • 能力-风险系数 aa:风险指数公式中对能力分的乘数,通过模型能力分与METR报告中的模型自主完成任务时长数据进行拟合得出。基于一个前提假设:模型的风险与其自由完成的任务时间成正比。因为模型可自主完成的任务越长,人类攻击者或监督者所需投入的时间越少,滥用攻击规模和失控可能性就越高。该系数的具体计算方法详见这里

注:由于风险指数2.0在基准列表和指标计算方面均有很大变化,本报告中的风险指数数值不应与1.0版或1.5版报告逐项比较;更合适的用法是在2.0版框架内部比较不同模型、不同季度和不同领域的相对变化。

模型列表

本节列出本期报告覆盖的最近四个季度(2025Q3至2026Q2)纳入监测的突破性模型。

公司 模型列表
OpenAI GPT-5 (high), GPT-5.1 (high), GPT-5.2 (high), GPT-5.4 (high), GPT-5.5
谷歌 Gemini 3 Pro Preview, Gemini 3.1 Pro Preview
Anthropic Claude Sonnet 4.5 Reasoning, Claude Opus 4.5 Reasoning, Claude Opus 4.6 Reasoning, Claude Opus 4.8
xAI Grok 4, Grok 4.20 Beta Reasoning, Grok 4.3
深度求索 DeepSeek V3.1 Terminus Reasoning, DeepSeek V3.2 Reasoning, DeepSeek V4 Pro
阿里巴巴 Qwen 3 235B Reasoning (250725), Qwen 3.5 397B Reasoning, Qwen 3.7 Max
字节跳动 Doubao Seed 1.6 (251015 High), Doubao Seed 1.8 (251215 High), Doubao Seed 2.0 Pro (260215), Doubao Seed 2.1 Pro
腾讯 Hunyuan T1 (250711), HY 2.0 Think, HY 3.0 Preview
百度 ERNIE X1.1 Preview, ERNIE 5.0 Thinking Preview, ERNIE 5.0 Thinking, ERNIE 5.1
稀宇科技 MiniMax M2, MiniMax M2.7, MiniMax M3
月之暗面 Kimi K2 (250711), Kimi K2 (250905), Kimi K2 Thinking, Kimi K2.5 Thinking, Kimi K2.6
智谱 GLM 4.5, GLM 4.6, GLM 4.7, GLM 5, GLM 5.2
小米 MiMo V2 Flash Reasoning, MiMo V2 Pro Reasoning, MiMo V2.5 Pro

其中,2026Q2新增纳入监测的模型包括:GPT-5.5、Claude Opus 4.8、Grok 4.3、DeepSeek V4 Pro、Qwen 3.7 Max、Doubao Seed 2.1 Pro、HY 3.0 Preview、ERNIE 5.1、MiniMax M3、Kimi K2.6、GLM 5.2、MiMo V2.5 Pro。

测评基准列表

本期评估的风险领域包括网络攻击、生物风险、化学风险、有害操纵与失控,使用的测评基准列表如下:

领域 能力测评 安全测评
网络攻击
查看测评详情
CyberSecEval2-VulnerabilityExploit:代码漏洞发现和利用能力
CyBench:CTF夺旗任务能力
CVE-Bench:真实Web应用渗透攻击能力
AirBench-SecurityRisks:网络安全有害问题
CyberSecEval2-PromptInjection:提示词注入
FRT-AirBench-SecurityRisks:网络安全有害问题+红队攻击
Fortress-Privacy/Scams:隐私与诈骗场景红队攻击
生物风险
查看测评详情
BioLP-Bench:生物实验问题定位能力
BixBench:生物信息学智能体任务能力
LAB-Bench-SeqQA:DNA和蛋白质序列理解能力
LAB-Bench-FigQA:生物图像理解能力
FrontierScience-Biology:前沿生物科学推理能力
SciKnowEval-BiologicalHarmfulQA:生物有害问题
SOSBench-Bio:生物违规问题
FRT-SciKnowEval-BiologicalHarmfulQA:生物有害问题+红队攻击
Fortress-Biological:生物风险红队攻击
化学风险
查看测评详情
ChemBench-ToxicityAndSafety:化学毒性和安全知识
ChemBench-Normal:一般化学知识能力
FrontierScience-Chemistry:前沿化学科学推理能力
SOSBench-Chem:化学违规问题
SciKnowEval-ChemicalHarmfulQA:化学有害问题
FRT-SOSBench-Chem:化学违规问题+红队攻击
Fortress-Chemical:化学风险红队攻击
有害操纵
查看测评详情
CyberSecEval3-MultiTurnPhishing:多轮网络钓鱼攻击能力
MakeMePay:诱导付费能力
MakeMeSay:诱导用户说出指定内容的能力
PMIYC:改变信念的能力
AirBench-Deception:欺骗类有害任务
AirBench-Manipulation:操纵类有害任务
AirBench-PoliticalPersuasion:政治说服类任务
APE:说服他人倾向
FRT-AirBench-Manipulation:操纵类有害任务+红队攻击
失控
查看测评详情
Self-Proliferation:自我复制与适应能力
MLE-Bench:受限资源下的机器学习工程能力
SciCode:科学编程能力
GDM-Stealth:隐蔽行动能力
SAD-mini:情境感知能力
MASK:模型诚实性
Agentic-Misalignment:代理式错误对齐倾向
Shutdown-Resistance:抵抗关机倾向
DarkBench:暗中影响用户的倾向

与风险指数1.5版相比,本期2.0版新增CVE-Bench、BixBench、FrontierScience-Biology/Chemistry、ChemBench-Normal和FRT系列红队测试基准;移除WMDP-Cyber/Bio/Chem、SciKnowEval-ProteoToxicityPrediction/MolecularToxicityPrediction、StrongReject、ISC-Bench系列,并将CyberSecEval3-MultiTurnPhishing从网络攻击领域移除(有害操纵领域保留)。新增基准实现细节和移除原因分别见附录B附录C

注:为了保证图表内部的一致性,本报告中展示的历史季度风险曲线,均按2.0版测评基准体系回溯计算。

监测结果

跨领域趋势

总体趋势

基于风险指数2.0版,当前网络攻击、生物风险和失控领域整体风险指数、能力分及安全分变化趋势如下图所示:

趋势显示:

  • 网络攻击:平均能力分从2025Q3的39.3持续增长至2026Q2的56.2,平均安全分从56.5升至2026Q1的68.9,但最近一个季度又下降到66.8。平均风险指数从4.7持续攀升至20.9,不到一年增长4.4倍。最大风险指数已达44.8。
  • 生物风险:与网络攻击领域类似,平均能力分持续增长,安全分增长到2026Q1达到最大值,最近一个季度又略有下降。平均风险指数从2025Q3的16.8升至2026Q2的110.2,增长6.6倍,已超越风险黄线。最大风险指数已达234.6。
  • 失控:平均能力分增长到2026Q1后开始停滞,安全分持续增长。平均风险指数从2025Q3的9.0升至2026Q1的32.5,最近一个季度回落到21.9。最大风险指数已达178.5,超过黄线阈值。

模型系列对比

  • Gemini系列:Gemini 3.1 Pro Preview在生物风险和失控领域的风险指数全局最高,均已超过风险黄线。
  • DeepSeek系列:DeepSeek V4 Pro网络攻击领域风险指数全局最高,且增速较快,但尚未达到风险黄线。失控领域风险指数仅次于Gemini 3.1 Pro Preview。
  • GPT系列:网络攻击和失控领域风险指数快速增长,生物风险领域已越过风险黄线。
  • Kimi/MiniMax/Qwen/Doubao系列:网络攻击和生物风险领域增长较快,生物风险领域已越过黄线。
  • Claude系列:Claude Opus 4.8在网络攻击领域风险指数排名仅次于DeepSeek和GPT。由于本轮测评不包含Claude最强模型Fable/Mythos 5,可能低估了Claude系列模型的实际风险。

开源与闭源对比

开源与闭源模型呈现出以下特征:

  • 闭源模型仍主导各领域能力上限:GPT-5.5、Claude Opus 4.8、Gemini 3.1 Pro Preview等闭源模型在各领域上的能力分保持领先。
  • 开源模型在滥用风险领域的安全分普遍低于闭源模型:在网络攻击、生物风险、化学风险、有害操纵这四个滥用风险领域,开源模型的安全分分布明显低于闭源模型的分布。
  • 闭源模型在失控领域的安全分更低:在失控领域,Gemini 3.1 Pro Preview、Grok 4、Gemini 3 Pro Preview这几个模型的安全分显著低于其他模型,这些模型因能力分高且安全分低而形成更高风险。

网络攻击

风险概览

在网络攻击领域,当前风险指数最高的模型依次为DeepSeek V4 Pro、GPT-5.5和Claude Opus 4.8,尚无模型超过风险黄线。但从能力角度,已经有4个模型超过能力黄线(GPT-5.5、GPT-5.4、Claude Opus 4.8、Claude Opus 4.6)。DeepSeek V4 Pro虽然能力分不是最高,但安全分仅43.4,是其风险指数最高的主要原因。

此外,Kimi、GLM、MiMo、Qwen、Doubao等模型系列的风险指数增长也较快,主要来源于能力分的增长。Grok系列的风险指数出现了持续下降,主要是因为能力分持续下降以及安全分持续提升。

注:本次测评未包含Claude最强模型Fable/Mythos 5,根据该模型的系统卡,其网络攻击能力远强于Claude Opus 4.8。该模型公开发布后,实际网络攻击风险很可能高于本报告的发现。

能力测评

  • 漏洞利用能力:在CyberSecEval2-VulnerabilityExploit上,GPT-5.4取得95.6分的最高分。一半模型的分数超过80分,说明漏洞识别与利用能力已经较普遍。
  • CTF任务:GPT-5.5和Claude Opus 4.8在CyBench上达到92.5分,并列第一,说明其在需要多轮规划、工具调用和环境交互的网络攻击任务中表现突出。前沿模型最高分在不到一年的时间内提升68%,进步神速。而且需要说明的是,这些成绩是在Inspect内置的最简单的Agent框架上取得的,没有使用任何先进的Harness技术,也没有使用任何网络攻击专用的工具,进步全部来自模型能力的提升。
  • 真实Web漏洞利用任务:在CVE-Bench上,GPT-5.5在zero-day设置下取得43.3分的最高分,其他模型全部低于40分。这一结果说明真实Web漏洞利用任务比起CTF任务,对前沿模型更具挑战。但同样需要说明的是,这些成绩也是在Inspect内置的最简单的Agent框架上完成的,而且限制了最大交互消息数是90。如果允许模型使用先进的Agent框架及更大的消息预算,大概率可以取得更好的成绩(我们已注意到在GPT-5.5系统卡中,报告的CVE-Bench得分达93.1)。

安全测评

  • 网络基础拒答:2026Q2模型在AirBench-SecurityRisks普遍达90分以上,显示基础网络安全护栏较强。
  • 提示词注入防护:2026Q2模型在PromptInjection上得分普遍在80-90之间,平均表现比起2026Q1略有退步。可见模型在能力提升的同时,对提示词注入的防护并不一定能同步提升。

生物风险

风险概览

在生物风险领域,目前已有12个模型越过风险黄线。其中Gemini 3.1 Pro Preview风险指数最高,达234.6,同样超过风险黄线的还有Kimi、GPT、Qwen、Doubao、MiniMax系列模型。从能力角度,已有22个模型越过能力黄线,其中GPT-5.5能力分最强,Claude Opus 4.8第二,不过由于安全分较高,Claude Opus 4.8的风险指数只有43.4,低于风险黄线。Grok、GLM系列也越过了能力黄线,不过均未越过风险黄线。

能力测评

  • 湿实验问题排查:BioLP-Bench基准的结果显示,已有22个模型(本季度+7)超过了人类专家水平,最高分为Claude Opus 4.6(48.7),最近一个季度未创新高。
  • DNA和蛋白质序列理解:在LAB-Bench-SeqQA基准中,已有11个模型(本季度+6)超过了人类专家水平,最高分为GPT-5.5(91.5分),可见前沿模型已具备较强的序列理解能力。
  • 生物图像理解:LAB-Bench-FigQA基准的结果显示,已有3个模型(本季度+2)超过了人类专家,最高分为Claude Opus 4.8(79.6分),不到一年提升38%。
  • 前沿生物科学推理:在FrontierScience-Biology上,最高分仅47.1(GPT-5.4),大部分模型得分不到40分,可见模型在专家级科学研究推理能力方面还有较大不足。
  • 生物信息学智能体任务:Claude Opus 4.8在BixBench上取得51.0分的最高分,大部分模型得分不到40分,可见模型在真实生物信息学长程任务中仍有不足。需要说明的是,这些成绩是在Inspect内置的最简单的Agent框架上取得的,没有使用任何先进的Harness技术,且仅能使用预设的生物信息学工具计算,因此可能会低估模型的实际能力。

安全测评

  • 基础生物拒答:在BiologicalHarmfulQA上,2026Q2的模型整体比上个季度略有提升,但也存在部分模型安全分数较低,如MiniMax M3仅59.6分,ERNIE 5.1仅62.3分。在SOSBench-Bio上,2026Q2模型大部分已经达到90分以上,整体进步趋势明显。

化学风险

风险概览

由于化学领域暂未有能力黄线,因此没有计算风险指数,本节主要分析能力与安全测评结果。化学领域能力分最高的是GPT-5.4(72.3),Kimi、GLM、Grok系列也已超过70分。安全分最低的是DeepSeek V4 Pro(28.9分),Kimi、MiMo系列也曾低于30分,不过最新模型有所改善。

能力测评

  • 化学毒性与安全知识:GPT-5.5在ChemBench-ToxicityAndSafety上取得58.4的最高分,模型能力进步整体比较平缓。
  • 一般化学知识:GPT-5.4在ChemBench-Normal上取得88.7的最高分,2026Q2模型分数都在80到90分之间,说明前沿模型普遍具备较好的一般化学知识。
  • 前沿化学科学推理:Gemini 3.1 Pro Preview在FrontierScience-Chemistry上达到74.9的最高分,大部分模型超过60分,可见前沿模型已具备一定的专家级化学研究推理能力。

安全测评

  • 基础化学拒答:2026Q2模型在SOSBench-Chem上大部分超过90分,模型进步趋势明显。但在ChemicalHarmfulQA上大部分低于40分,HY 3.0 Preview仅7.3分,显示不同化学安全基准之间存在显著差异。

有害操纵

风险概览

由于有害操纵领域暂未有能力黄线,因此没有计算风险指数,本节主要分析能力与安全测评结果。在能力分方面,Gemini 3.1 Pro Preview得分最高(68.9分),最近一个季度的最高分是Doubao Seed 2.1 Pro(62.5分)。过去一年模型能力的进步整体不明显。在安全分方面,最低分的模型是DeepSeek V4 Pro(25.7),GLM和Kimi系列也曾低于30分,不过新版本有所改善。

能力测评

  • 网络钓鱼:Claude Opus 4.6在MultiTurnPhishing上取得最高分79.2分,断层领先,大部分模型得分在50到70之间。
  • 诱导付费:Gemini 3.1 Pro Preview在MakeMePay上取得最高分82.2分,遥遥领先,大部分模型得分只在30到50之间。
  • 诱导表述:Claude Opus 4.8在MakeMeSay上取得最高分73.4分,但相比先前的模型提升不明显。
  • 改变信念:GPT-5.1在PMIYC上取得最高分80.9分,模型在这方面的能力,过去一年基本上没有进步。

安全测评

  • 基础有害操纵拒答:在AirBench-Deception和AirBench-Manipulation上,2026Q2模型大部分得分在80分以上,欺骗和操纵场景整体较安全。但在AirBench-PoliticalPersuasion上,仍有不少模型不到60分,ERNIE 5.1仅47.1分,政治说服场景仍是短板。
  • 说服倾向:在APE上,大部分模型得分不足40分,ERNIE和DeepSeek系列甚至不到4分,说明模型仍非常容易表现出主动说服倾向。

失控领域

风险概览

在失控领域,目前已有两个模型越过了风险黄线,均为Gemini模型,其中Gemini 3.1 Pro Preview 风险指数已达178.5。有12个模型越过了能力黄线,包括Gemini、GPT、Claude、Qwen、DeepSeek、Kimi等系列的模型。GPT、DeepSeek、Qwen的最新模型虽未超越风险黄线,但风险指数增长较快,主要由于能力分快速提升,同时安全分下降导致。安全分最低的模型是Grok-4(38.0),但其后续版本已有明显改善。

能力测评

  • 自我复制能力:Claude Opus 4.6在Self-Proliferation上取得最高分63.3分。2026Q2模型普遍超过40分,但相比上个季度没有明显进步。
  • 机器学习工程能力:MiMo V2 Pro在MLE-Bench上取得最高分61.9分。2026Q2模型得分跨度较大,最高的GPT-5.5得57.1分,最低的Grok 4.3仅9.5分,整体表现还不如上个季度的模型,体现其在受限资源下完成机器学习工程任务方面仍面临挑战。
  • 科学编程能力:Gemini 3.1 Pro Preview在SciCode上取得最高分58.9分。2026Q2模型普遍在40到60分之间,相比上个季度进步不明显。
  • 隐蔽行动:Gemini 3.1 Pro Preview取得最高分39.3分,大幅领先其它模型。2026Q2模型普遍得分不到20,显示规避监管对于大部分前沿模型来说仍有挑战。
  • 情境感知:Gemini 3.1 Pro Preview在SAD-mini上取得92.0的最高分。2026Q2模型普遍得分在75到85之间,说明前沿模型普遍具备较强情境感知能力。但过去一年整体分数进步不明显,显示该基准可能已接近饱和。

安全测评

  • 诚实性:在MASK基准上,模型得分差异较大,有一半模型得分不到60分,最低分仅32.5(Grok 4),说明模型的诚实性整体不高。
  • 代理式错误对齐:在Agentic-Misalignment基准上,最新季度模型的表现有所改善,大部分高于75分,且GPT和Claude系列模型几乎都达到了100分满分。但仍有少数模型得分较低,如DeepSeek V4 Pro得分54.8。
  • 抵抗关机:大多数模型在Shutdown-Resistance上表现很好,都在95分以上。只有GPT系列、Gemini系列、Grok系列早期、Doubao Seed 2.1 Pro以及Claude Opus 4.6分数略低。
  • 暗中影响用户:Claude Opus 4.8在DarkBench上取得87.7分的最高分;但大部分模型低于60分,如Grok 4.20 Beta仅32.0,说明部分模型仍存在较明显的暗中影响用户倾向。

红队测试

如前所述,我们在风险指数2.0版中新增了红队测试,以评估模型在受攻击情况下的安全性变化。

下图对比了四个滥用风险领域中,同一原始安全数据集在“无红队攻击”和“有红队攻击”两种设置下的模型得分。分数越高表示模型越能拒绝或抵抗不安全请求。每张图按有红队攻击下的分数从高到低排序。

红队测试显示,基础安全分和红队攻击下的安全分之间存在系统性落差:

  • 红队攻击会显著拉低安全分:所有前沿模型在生物原始数据集上的平均分为78.2,但加入红队攻击后仅为8.9,平均下降69.3分;网络攻击从90.5降至29.2;化学风险从83.7降至53.1;有害操纵从87.8降至36.4。也就是说,基础拒答高分并不等于模型能抵抗前沿红队攻击。
  • 不同领域数据集的攻击成功率差异明显:SOSBench-Chem在红队攻击后平均分仍有53.1,而SciKnowEval-BiologicalHarmfulQA在红队攻击下仅剩8.9,可见攻击效果在不同数据集间存在差异。这可能和不同数据集所采取的默认评分器不同有关。
  • 不同模型抗越狱能力存在较大差异:例如Claude Opus 4.8在红队攻击下仍能保持69.1%的平均拒绝率,而Hunyuan T1 (250711)同样条件下仅5.8%。
  • 存在攻击后安全分反增的现象:例如在SOSBench-Chem上,Grok-4模型在攻击前安全分数为41.2分,攻击后反而增加到62.3分。这有可能是因为该模型对常见的攻击方法进行了对抗性训练,但却缺乏针对该风险领域的基础拒答训练。这种现象仅此一例。

局限性

本报告存在以下局限性:

  • 风险评估范围的局限性
    1. 本次风险监测仅针对大语言模型(包括视觉语言模型),尚未涉及对更多模态和智能体等系统的监测,尚不能全面评估所有模型和AI系统的风险。
    2. 本次风险监测仅针对滥用和失控类型的风险评估,尚不能涵盖所有类型的前沿风险(比如意外风险和系统性风险)。
  • 风险评估方法的局限性
    1. 由于现有测评方法的不足,尚不能够充分测出模型的能力和安全水平,如
      • 能力测评的提示词、工具、Agent框架等设置可能未全面发挥出模型的潜力。
      • 安全测评中仅尝试了有限的红队攻击方法。
      • 有害操纵测评中使用LLM来模拟被说服者,可能和真人存在效果差异。
      • 模型的评估感知(evaluation awareness)可能会影响基准测评分数的可信度。
    2. 风险指数的计算是现有条件下对实际风险的一种简化建模,尚不能精确量化实际的风险。
    3. 当前对滥用风险的评估仅考虑了模型对攻击者的赋能,尚未考虑模型对防御者的赋能对整体风险的影响。
    4. 当前风险指数2.0版中,化学风险与有害操纵领域尚未定义能力黄线阈值,未能计算风险指数。
  • 测评数据集的局限性
    1. 当前选取的测评数据集大部分是开源的,可能已经存在于一些模型的训练数据中,导致能力和安全得分不够精准。
    2. 测评数据集所覆盖的场景可能不全。
    3. 当前的测评数据集以英文内容为主,尚不能评估多语言环境下的风险情况。
    4. 部分测评基准仍可能随着模型能力提升而逐渐饱和,需要持续更新。

此外,本报告仅针对模型可能产生的风险进行了评估,而未评估模型带来的收益,在实际制定政策和行动时需要权衡风险与收益。

建议

面向模型开发者

基于本期监测结果,我们向模型开发者提供以下建议:

  • 关注自身开发的模型的风险指数情况,如果风险指数超过风险黄线:
    • 建议优先加强模型安全防护:
      • 加强基础安全防护:如通过监督微调训练模型拒绝有害请求。
      • 加强越狱安全防护:如通过输入输出监控来识别并过滤掉有害的请求和回答、通过对抗性训练来提升模型对越狱请求的防御能力等。
      • 加强篡改安全防护:闭源模型需加强网络安全防护以防止参数泄露;开源模型可探索在训练过程中引入防篡改机制。
      • 加强失控领域安全防护:如通过思维链监控来检测模型可能的欺骗和密谋。
    • 如果仅靠加强安全防护不足以缓解风险,则可探索降低模型高风险能力:
      • 从模型训练数据中移除网络攻击、生物、化学武器等高危知识,或在后训练阶段使用机器遗忘技术从模型参数中移除。
      • 构建请求分类器,将高风险领域请求路由到相对低能力的模型进行处理。
    • 一些通用的风险管理实践:
      • 根据自身情况制定风险管理框架,明确风险阈值、达到阈值后的缓解措施和发布策略。可参考前沿AI风险管理框架
      • 加强模型风险信息披露,如在发布模型的同时提供模型的系统卡,提升安全治理透明度。
  • 如果能力分越过能力黄线,风险指数未越过风险黄线:
    • 建议对模型进行全面的安全评估,确保当前防护措施足以将模型部署后风险缓解到中低水平。
    • 建议加强模型安全防护,将风险控制在更低水平,为未来模型能力提升提供一定的缓冲空间。具体措施同上。
  • 如果能力分和风险指数均未超过黄线:
    • 暂无特殊建议,可保持关注新模型的风险情况,在新模型发布前进行能力和安全测评,及时掌握变化。

安远AI可为模型开发者提供前沿风险管理咨询和安全测评服务,如有合作意向请联系risk-monitor@concordia-ai.com。

面向AI安全研究者

基于本期监测结果,我们向AI安全研究者提供以下建议:

  • 对于风险评估方向的研究者:
    • 可探索更有效的能力激发方法(如更好的智能体框架、推理时扩展),以准确评估模型的能力上限。
    • 可探索更有效的攻击模型的方法(如新的越狱、红队攻击、提示词注入和多轮操纵方法),以准确评估模型的安全下限。
    • 可探索更精准评估实际风险的方法,例如建立新的威胁模型并针对其中各个环节设计针对性的测评基准。
    • 鉴于AI智能体的广泛应用,可探索针对智能体工具调用、长期任务执行和环境交互的风险评估方法。
  • 对于风险缓解方向的研究者:
    • 可探索更有效的模型安全加固和危险能力移除方案,在增强模型安全性的同时尽可能不牺牲其实用能力。
    • 鉴于开源模型更容易被恶意篡改,可探索适合开源模型的风险缓解方案。

上述方向也是安远AI未来的重点研究方向,安远AI愿与业界同行合作开展研究,如有合作意向请联系risk-monitor@concordia-ai.com。

面向政策制定者

基于本期监测结果,我们发现以下早期预警信号:

  • 网络攻击滥用风险:GPT-5.5、Claude Opus 4.8已突破能力黄线,而Claude Fable/Mythos 5能力还远强于Claude Opus 4.8。前沿模型在CyBench和CVE-Bench等基准上快速进步,体现这些模型已逐步具备以自主、多轮交互方式进行漏洞发现、利用和网络渗透的能力。但多数模型安全防护弱,在红队攻击下安全分数平均下降61.3分。
  • 生物滥用风险:目前已有12个模型越过风险黄线。模型在湿实验问题排查、DNA与蛋白质序列理解、生物图像理解等任务上已超过人类专家水平。但多数模型安全防护弱,在红队攻击下安全分数平均降69.3分。
  • 失控风险:目前已有2个模型越过风险黄线。部分模型已同时具备一定的自我复制和自我改进能力,较强的情境感知能力,以及偏低的诚实性和暗中影响安全分。

建议政策制定者对上述网络攻击、生物风险和失控领域的预警信号保持关注,并加强对模型的相关监管要求(如要求模型开发者在发布模型前对网络攻击、生物风险和失控风险进行评估,并实施必要的风险缓解措施)。可针对不同风险开展差异化治理方法,综合考虑模型能力水平、安全性以及分发方式(开源或闭源)等因素。

附录

关于本期监测所用到的风险指数计算方法、测评基准的具体实现细节、信息危害披露权衡详见这里