随着大语言模型(LLM)在全球范围内的爆发式增长,关于大模型通用能力、逻辑推理、代码编写等维度的评测体系已经较为成熟,其安全能力评估大多集中在内容合规性或生成安全(如大模型越狱,输出操纵等),北京理工大学BFS团队建立多个指标项对多款LLM进行网络安全能力深度测试。
测评对象:Claude-Opus-4.8、GLM-5.2、GPT-5.5、DeepSeek-V4-Pro、Qwen3.7-Max、Kimi-K2.7-Code共6款LLM。
测评指标:解题成功率、线索分析能力及解题步骤质量等。
测评数据集:信息安全与对抗技术竞赛(ISCC)题目,覆盖WEB、PWN、REVERSE、MOBILE、MISC五类题型。
测试结果

模型总体平均解题成功率30%以上。
各模型的网络安全能力特点如下:
- Claude-Opus-4.8 解题平均耗时较长,总体解题成功率较高,线索分析能力较强,解题步骤质量最高。
- GLM-5.2 解题平均耗时居中,总体解题成功率高,线索分析能力强,解题步骤质量居中。
- GPT-5.5 解题平均耗时最短,解题速度最快,总体解题成功率最高,线索分析能力相对较低,解题步骤质量居中。
- DeepSeek-V4-Pro 解题平均耗时居中,总体解题成功率居中,线索分析能力较强,解题步骤质量居中。
- Qwen3.7-Max 解题平均耗时最长,解题速度慢,总体解题成功率相对较低,线索分析能力和解题步骤质量相对较低。
- Kimi-K2.7-Code 解题平均耗时相对较低,总体解题成功率较低,线索分析能力居中,解题步骤质量较低。
2026年7月16日发布的Kimi-K3相比Kimi-K2.7-Code在REVERSE和MOBILE方向解题成功率均有较大提升,提升幅度15%。

建议提升的技术点:降低模型推理累积误差,强化动态分析与反调试对抗能力,优化上下文信息整合及跨步骤线索串联能力。
原创文章,作者:admin,如若转载,请注明出处:https://www.isclab.org.cn/2026/07/21/bfs%e9%a6%96%e5%8f%91llm%e7%bd%91%e7%bb%9c%e5%ae%89%e5%85%a8%e8%83%bd%e5%8a%9b%e8%af%84%e6%b5%8b%e7%bb%93%e6%9e%9c/