验证债务:AI 发现速度与人工验证能力脱节
AI 渗透测试面临一个“魔法师的学徒”难题。你对一把扫帚施咒让它打水,它就会不知疲倦地一直打水,哪怕工坊早已被水淹没。
行业正在忙着衡量 AI 发现漏洞的速度(说的就是你,Anthropic)。但很少有人会去核算:这些工作由谁来检查,成本几何?这个缺口有一个名字:validation debt(验证债务)——当发现速度扩大、而验证能力没有跟上时,不断堆积的未经验证的发现。
最近的一项调查询问了 158 名安全从业者:他们的团队能否对单次渗透测试中 AI 生成的 500 多个漏洞候选进行分诊。只有 20.3% 的人表示已经具备相应工作流程。38.6% 的人认为这个量级会让团队不堪重负,29.7% 的人表示完全无法处理。
这意味着,大多数团队购买的是自己无法处理的“发现能力”。只有团队能够分辨出哪些漏洞真实存在、哪些重要、以及如何处理时,发现更多漏洞才有意义。
当 AI 的发现超出团队处理能力时,会发生什么?安全团队多年来一直力图更频繁地测试更多应用。AI 终于让这成为可能。问题是,发现速度的增长远快于后续工作的跟进。仍然需要有人复现发现,确认漏洞是否可利用,并向工程团队提供足够的证据来采取行动。
在数量较低时,这行之有效。但当发现成百上千条时,团队就会不堪重负,甚至束手无策。一位受访者花了两天时间验证 AI 工具生成的 300 条发现,其中 250 条属于重复、不可利用的问题,或引用了不存在的漏洞。花两天时间做人工验证,并不是团队购买该工具所期望的效率提升。
AI 是在节省时间,还是把工作转嫁到别处?
对某些团队来说,或许如此。但大量的人工工作只是把问题向后推。81.7% 使用 AI 工具的从业者表示,“至少在某些时候”,AI 生成的发现需要大量的人工验证。如果自动化将漏洞发现时间缩短了 10 小时,却增加了 15 小时的验证和分诊时间,投资回报率(ROI)在哪里?你得到的只是验证债务。
发现能力相对容易扩展。AI 可以在人类测试人员所需时间的一小部分内探测潜在弱点,并生成候选发现。但每增加一条发现,团队就多一项需要检查的工作。验证并没有以同样的速度扩展,因为一条看似合理的发现仍然需要证据支持。某些漏洞最终会被证实不可利用,另一些则会重复指向同一根本问题。如果受影响的资产并不危及业务,单一的严重性评级也说明不了什么问题。
那么,一条糟糕的发现究竟要花多少成本?每一条低置信度的发现,都需要花时间丢弃。误报通常被当作准确性问题来讨论。但对于做投资决策的安全负责人来说,它们消耗的时间同样重要。按每条 5 分钟计算,验证 1000 条发现需要 80 多个小时。而且 5 分钟已经是乐观估计——取决于分析人员是需要复现问题、理解上下文、确认是否可利用,还是以上全部。
当 AI 的输出看起来非常权威时,情况会更糟。AI 生成的发现看起来令人信服,因为它们带有精心编写的描述、严重性评级、攻击叙事和修复建议。但这些都不是证据。在让开发人员修复之前,仍然需要有人确认发现真实存在。工具的价格一目了然,但检查工具产出所花费的时间却不那么明显。
为什么有些团队能更好地应对 AI 洪流?
测试成熟度会产生差异。在每月测试少于 5 次的团队中,只有 4% 表示已经建立了处理 AI 生成的大量发现的正式工作流程,55% 表示这样的量级将无法管理。测试更频繁的团队能更好地应对大规模发现。他们拥有更好的流程,也更不容易被发现淹没。测试频率最高时,样本量会变小,因此应将其视为一种趋势,尽管这个趋势很能说明问题。
测试足够频繁,你就必须善于分诊——必须有人负责这件事。发现必须达到标准,垃圾信息必须排除在队列之外。不频繁的测试可能掩盖薄弱的流程,而 AI 生成的大量发现会很快让这些弱点暴露出来。
你的团队能处理 AI 工具产出的结果吗?首先要考虑团队处理产出的能力。评估 AI 渗透测试工具的安全负责人需要知道当前测试会产生多少工作量,以及当工作量突然暴增时会发生什么。几个问题有助于找出差距:
-
你的团队每周实际能验证多少条发现?
-
在工程团队接受一条发现之前,需要附带哪些证据?
-
分析人员有多少时间花在了验证毫无结果的发现上?
-
如果测试产出增加五倍,而修复能力没有增加,会发生什么?
在宣布任何效率收益(或鹦鹉学舌地复述你偏爱的供应商的说辞)之前,应先把这些成本纳入商业论证。如果团队无法处理,生成 10 倍的发现并不会让安全能力提升 10 倍,只会产生一个更大的队列。
你需要更多人,还是更好的流程?两者都需要,但比例并非相等。更好的流程可以帮助团队消化更多发现,但不能让专家验证变成零成本。招聘更多分析人员不是唯一答案。减少可避免的工作是一个好的起点。
明确“已验证”的标准。坚决去重,避免同一个弱点因为技术原因不同而变成多个工单。基于风险进行优先级排序,不要将所有技术上有效的漏洞都一视同仁。测试频率也很重要。定期测试的团队有更多机会改进发现从接受到验证、修复、再测试的流程。如果每条 AI 生成的发现仍需要大量专家调查,更高的发现率必然意味着更多人力。这一成本属于自动化经济学的一部分。
不要只盯着 AI 发现了多少漏洞
我们总是以“能发现多少”来评判安全工具。AI 可以把数字推得很高,但发现更多并不能说明安全团队是否完成了更多工作。更好的衡量标准是这些发现最终如何被处理。有多少被快速验证?有多少促成了修复?为此投入了多少人力?这些问题的答案,才能告诉安全负责人 AI 是否真正帮助他们提升了效率。
AI 渗透测试的成本不止于许可证费用,还包括验证 AI 所发现漏洞所需的人员和流程。如果忽视这些成本,自动化带来的工作量将比它减少的更多。
信息来源:51CTO https://www.51cto.com/article/852821.html