Antares安全小模型评测图
当AI开始大量参与写代码,软件行业正在出现一个明显的不对称:生成代码的速度越来越快,但检查代码是否安全的速度并没有同步提升。一个开发团队可以让智能体在几分钟内生成数百行功能代码,却仍然需要安全人员逐个项目查看依赖、调用链和潜在漏洞。7月21日,思科发布并开源Antares安全小模型,希望把这项昂贵、耗时、又涉及敏感代码的工作,变成可以在本地持续运行的自动化流程。
Antares并不是通用聊天模型,也不是用来替程序员修复所有Bug的“万能编码助手”。它专门解决一个更窄但很实际的问题:当安全团队已经知道某类漏洞可能存在时,如何在庞大的代码仓库中定位最值得怀疑的文件。思科首批开放了Antares-350M和Antares-1B两个模型的权重,并表示更大的3B版本随后推出。350M和1B意味着模型参数规模分别约为3.5亿和10亿,和动辄数百亿、上千亿参数的通用大模型相比,它们显得非常小。
模型小并不代表任务简单。现实中的漏洞定位往往不是在单个函数里寻找一个明显的危险关键词。安全人员可能拿到的是一条CVE公告、一种CWE漏洞类型,或者一段对攻击条件的描述,然后需要进入一个陌生项目,理解目录结构,搜索相关函数,追踪数据从哪里进入、经过哪些处理、最终流向什么敏感操作。真正有问题的代码可能分散在多个文件中,也可能被封装、继承和配置层层遮挡。
思科介绍,Antares采用类似人工调查的迭代搜索方式。模型从漏洞描述出发,通过终端搜索代码模式,读取候选文件,把新证据加入判断;发现某条路径没有价值时,它会调整方向或回退,最后输出最可能包含漏洞的源文件排序,以及形成判断时的终端探索轨迹。这个结果不是直接宣布“漏洞已经确认”,而是帮助安全人员缩小范围,让人工把时间优先花在高风险位置。
Antares最值得关注的地方,其实不是排行榜,而是部署方式。企业的源代码往往包含核心业务逻辑、接口密钥线索、内部架构和尚未公开的产品信息。把整个仓库发送到外部云模型,可能触及商业保密、客户合同和监管要求。小模型可以在开发者电脑、企业服务器或隔离网络中运行,代码不必离开本地环境,这对政府、金融、科研机构和传统工业企业尤其重要。
本地运行还意味着成本结构不同。大型模型按Token收费时,持续扫描每次提交可能非常昂贵。安全检查如果只能在重大版本发布前偶尔进行,就很难跟上AI编码带来的提交速度。像Antares这样更小、更专用的模型,理论上可以接入CI/CD流水线,在每次代码提交或合并请求时执行初步定位。它不一定给出最终结论,但可以像一道低成本筛网,先把明显值得审查的文件挑出来。
这种思路与过去“一个大模型包办所有任务”的路线不同。通用大模型优势在于知识广、理解灵活,可以解释代码、生成补丁和处理开放问题;专用小模型则可以针对一种任务反复训练,获得更低延迟和更稳定的输出。未来的软件开发工具链很可能不是只有一个最强模型,而是由多个模型协作:通用编码智能体负责开发,安全小模型负责检查,测试模型负责生成用例,人工工程师负责确认关键决策。
不过,小模型也有明显限制。第一,定位可疑文件不等于确认漏洞。一个危险函数可能受到严格权限和输入校验保护,也可能只是测试代码;反过来,真正的漏洞可能来自多个模块组合,单看某个文件很难判断。第二,模型会受到训练数据和基准分布影响,面对新的编程语言、内部框架或非常规架构时,效果可能下降。第三,攻击者也可以刻意通过混淆、生成代码和复杂依赖隐藏风险。
这次发布还反映出AI安全正在从“让模型拒绝危险问题”走向更工程化的阶段。随着编码智能体能够连续修改文件、运行命令和提交代码,安全不能只在项目结束时进行一次审计,而要贴近生成过程持续检查。思科提出的目标,是让便宜的小模型在代码进入主分支之前就进行验证,相当于在AI写代码的旁边,再放置一个不会疲劳的安全审查员。
但企业不能因为有了AI审查员就放松人工责任。模型给出的可疑文件排序,需要明确的置信度、可回看的搜索轨迹和人工确认。自动阻止提交的阈值如果设置过低,会制造大量误报并拖慢研发;设置过高,又可能漏掉真正风险。部署者还要持续评估模型在自己项目中的表现,而不是只引用厂商公布的平均分数。
从行业角度看,Antares代表一种可能更务实的AI落地方式:不追求让模型表现得无所不能,而是围绕高成本、重复、隐私敏感的工作做专门优化。只要它能稳定减少安全人员搜索代码的时间,即使不能自动修复漏洞,也有实际价值。
当AI让代码生产越来越便宜,验证代码就会成为新的稀缺能力。未来真正成熟的开发体系,可能不是比谁生成得最多,而是比谁能用更低成本持续证明这些代码值得信任。Antares能否做到这一点,还需要更多真实项目验证,但它已经把一个重要方向摆到台前:保护软件安全的模型,不一定非得是最大、最贵的那个。
信息来源:Cisco官方发布、Antares模型与漏洞定位基准相关公开资料。文中性能结论为思科在其专项基准上的官方披露,不能直接代表所有代码仓库。配图来自Cisco官方评测图。