随着智谱最新大语言模型GLM-5.3的发布,国产大模型再次吸引了全球的关注。在多项主流基准测试中,GLM-5.3位居所有已开源或即将开源模型中的第一;其在编程与智能体任务上的能力,已逼近Claude Fable 5、GPT-5.6 Sol等海外顶尖模型。为了探究GLM-5.3的网络安全能力,北京理工大学BFS团队对其进行了深度测试。
测评对象:GLM-5.2、GLM-5.3。
测评指标:解题成功率。
测评数据集:信息安全与对抗技术竞赛(ISCC)题目,覆盖REVERSE、MOBILE两类题型。
测试结果

结果显示,GLM-5.3总体解题成功率由32.5%提升至57.5%。其中,Reverse成功率由35%提升至55%,Mobile成功率由30%提升至60%。
与GLM-5.2相比,GLM-5.3在算法识别、跨文件线索整合、Java与Native代码联合分析以及解题结果验证方面进步明显,尤其擅长处理中等难度的Mobile题目,能够更完整地串联资源文件、DEX、JNI和Native库中的关键逻辑。
另一方面,GLM-5.3在部分高难度题目上搜索方向不易收敛,容易陷入过度思考,导致解题时间过长并且结果稳定性不足。
总体来看,GLM-5.3的主要进步是能够将分散线索组织成更完整、可执行、可验证的解题流程,但在面临复杂动态分析和高难度密码学约束时仍有提升空间。
原创文章,作者:admin,如若转载,请注明出处:https://www.isclab.org.cn/2026/08/31/bfs%e4%b9%8bllm%e7%bd%91%e7%bb%9c%e5%ae%89%e5%85%a8%e8%83%bd%e5%8a%9b%e8%af%84%e6%b5%8b%e7%bb%93%e6%9e%9c%ef%bc%882%ef%bc%89glm-5-3/