使用场景
AI 智能体开发者或安全研究员在需要评估自家 Web 渗透 agent 的真实解题能力时,把 agent 接入 30 个 Docker 化 Web 安全靶场,让 agent 自行探测并提交 flag,最终得到一份可对比的通过结果。
公开材料未直接描述旧做法;从产品定位推断,用户此前可能自建靶场、使用通用 CTF 题目或人工复核 agent 输出,缺少带标准答案的 Web 渗透专项基准。
公开材料显示靶场由真实 bug bounty 发现改编并配有标准 flag 与参考解题脚本,说明此前评测 agent 时缺少统一、可复现的判定基准,只能自建环境或人工核对,结果难以横向比较。
xOcto 的判断
需求有依据
趋势是安全攻防开始出现可复现的评测靶场,把 agent 能力从演示拉到可计分。切入可考虑为安全团队做私有靶场与评分服务,或把靶场结果接入企业招聘与外包验收环节;定价与付费方尚未披露,属推断。
使用理由
为什么用户会选择它
推断:相较自建靶场或人工核对,该产品把 30 个真实漏洞场景、标准 flag 与参考解题脚本打包成 Docker 靶场,agent 提交 flag 后由系统自动判定,省去搭建环境和人工判分两步,因此需要可复现横向对比的 agent 开发者会在评测阶段选择它。
还不能轻易下结论的地方
真正值得继续追问的矛盾
追踪该 公开代码仓库 仓库的 README、部署文档与 issue/discussion,确认 30 个 Docker 靶场能否按文档复现运行、标准 flag 判定是否稳定,以及是否有外部用户报告实际评测结果。