AI Act 差距评估:评估合规成熟度
AI Act 差距评估是一项包含 50 个问题的全面评估,用于对照 EU AI Act 的关键要求衡量您组织的合规成熟度。该评估分为八个章节,每个章节对应一个主要合规领域。完成此评估后,系统会生成合规评分、逐章明细,以及一份针对组织薄弱环节的自动整改计划。本文介绍该评估的方方面面:其结构、评分方法、问题权重,以及评估结果如何转化为可执行的整改项目。
开始评估
在侧边栏中,转到 EU AI Act → 差距评估。如果您之前已完成过评估,这些评估会连同其日期、总体评分和状态一起列出。点击+ 新建评估即可开始一次新的评估。
评估每次只呈现一个章节。顶部的进度条会显示您已完成的章节(和问题)数量。您可以使用侧边栏中的章节列表,或使用“下一页”/“上一页”按钮在各章节之间切换。进入下一章之前,必须回答本章中的所有问题,但您可以保存进度并稍后返回:未完成的评估会被保留。
每个问题都有一个 0 到 4 的成熟度评分等级、一个权重指示(W1、W2 或 W3),以及一个可选的备注字段。请选择最能反映您当前状况的评分,并可添加备注,为您的回答提供背景说明或证据。备注字段在审计期间尤其有价值,因为它能展示每项评分背后的推理依据。
完成全部八个章节后,审核屏幕会显示您所有回答的摘要。在最终提交之前,您可以返回任意章节进行修改。点击提交评估即可最终确定。评估一经提交即被锁定,无法再编辑(但您可以随时开始一次新的评估,以便进行比较)。
评估章节和问题
50 个问题分布在八个章节中。每个章节都直接对应 EU AI Act 的一个或多个条款:
第 1 章:风险管理(Art. 9)
本章评估您的组织是否已为高风险 AI 系统建立风险管理体系,并在其整个生命周期内持续维护。问题涵盖:
- 是否存在成文的风险管理体系,用于识别、分析和评估已知及可预见的风险
- 使用适当的指标对风险管理体系进行定期测试和验证
- 将风险管理融入整体的 AI 开发和部署生命周期
- 识别并缓解与合理可预见的误用相关的风险
- 向部署者和受影响人员传达剩余风险
- 对照预先定义的指标和概率阈值对 AI 系统进行测试
第 2 章:数据与数据治理(Art. 10)
本章评估针对训练、验证和测试数据集的数据管理实践。问题涵盖:
- 数据治理和管理实践(收集、标注、清洗、丰富)
- 统计特性审查(偏差、缺口、不足之处)
- 训练数据的相关性、代表性和完整性
- 在具备合法法律依据的前提下适当使用个人数据
- 数据集中的偏差检测和缓解措施
- 数据质量指标和监控程序
- 数据来源和数据沿袭的记录
第 3 章:技术文档(Art. 11)
本章评估您的技术文档是否符合 Art. 11 和 Annex IV 的要求。问题涵盖:
- 技术文档是否按照 Annex IV 的要求完整齐备
- 系统描述、设计规范和开发过程的记录
- 监控、测试和验证程序的记录
- 在 AI 系统的整个生命周期内保持文档最新
- 主管当局在提出要求时能够获取相关文档
- 技术文档的版本控制和变更管理
第 4 章:记录保存与日志记录(Art. 12)
本章评估您的高风险 AI 系统的日志记录能力。问题涵盖:
- 自动记录事件(操作、输入、输出、决策)
- AI 系统的运行在其整个生命周期内均可追溯
- 与预期用途相适应的日志保留期限
- 保护日志免遭篡改和未经授权的访问
- 日志记录足以支持上市后监测和事件调查
- 符合 Regulation (EU) 2024/1689 Art. 12 的具体要求
第 5 章:透明度与用户信息(Art. 13)
本章评估透明度措施,以及向部署者和用户提供的信息。问题涵盖:
- 在设计上具备足够的透明度,使部署者能够正确解读和使用输出
- 随 AI 系统提供的使用说明(预期用途、局限性、已知风险)
- 关于预期达到的准确性、稳健性和网络安全水平的信息
- 向受 AI 系统决策影响的人员作出明确披露
- 在有要求时就系统的 AI 属性保持透明(聊天机器人、深度伪造、情绪识别)
- 披露自动化决策,以及获得人工干预的权利
- 所提供的信息对目标受众而言易于获取和理解
第 6 章:人工监督(Art. 14)
本章评估是否已落实适当的人工监督措施。问题涵盖:
- 系统设计能够让自然人在使用期间进行有效监督
- 支持人在回路中(human-in-the-loop)、人在回路上(human-on-the-loop)或人类主导(human-in-command)方法的措施
- 监督人员能够充分了解 AI 系统的能力和局限性
- 能够正确解读 AI 系统的输出
- 能够决定不使用 AI 系统,或者推翻、忽略或撤销其输出
- 能够通过“停止”机制干预系统运行或中断系统
- 执行监督的人员的培训和能力
第 7 章:准确性、稳健性与网络安全(Art. 15)
本章评估您的 AI 系统的技术韧性。问题涵盖:
- 系统在设计和开发上能够针对预期用途达到适当的准确性水平
- 在随附的使用说明中声明准确性水平
- 能够抵御系统内部或其运行环境中的错误、故障和不一致
- 技术冗余解决方案(备份系统、故障安全计划)
- 能够抵御未经授权的第三方试图改变其用途或性能的行为(对抗性攻击)
- 与具体情况和风险相适应的网络安全措施
- 防范数据投毒、模型操纵和对抗性输入
第 8 章:合格评定与注册(Art. 16/43/49)
本章评估您的组织是否已为履行合格评定和注册义务做好准备。问题涵盖:
- 已建立涵盖 Art. 17 各个方面的质量管理体系
- 已确定合格评定程序(根据风险和领域选择内部评定或第三方评定)
- 为根据 Art. 49 在 EU 数据库中注册做好准备
- 了解 CE 标志程序并做好实施准备
- 已准备好符合性声明文件
- 上市后监测体系已与符合性要求相整合
评分方法
| 评分 | 成熟度等级 | 说明 |
|---|---|---|
| 0 | 不存在 | 针对此要求不存在任何措施、流程或文档。组织尚未开始处理这一领域。 |
| 1 | 初始 / 临时 | 已有一定认识,但措施是临时性的,没有形成文档,且应用不一致。可能存在个人层面的努力,但尚未正式化。 |
| 2 | 发展中 | 流程和措施已部分记录并实施。仍存在差距,且整个组织内的一致性有限。正式的计划正在制定中。 |
| 3 | 已定义并实施 | 流程已完整记录、获得批准,并在整个组织内得到一致实施。有可供查验的实施证据。 |
| 4 | 已优化并持续改进 | 流程不仅已全面实施,还会接受定期审核、持续改进和基准对标。组织超越了最低要求,展现出一流的实践水平。 |
问题权重
每个问题都被赋予一个权重,用以反映其对整体合规的相对重要性:
| 权重 | 标签 | 含义 | 对整改优先级的影响 |
|---|---|---|---|
| W3 | 严重 | 此要求对于满足监管合规至关重要。未能满足此要求会带来重大风险,可能导致执法行动、处罚或 AI 系统被禁止。这些通常是法规文本中设有明确截止期限或强制性义务的要求。 | 如果评分低于 3 → 生成一项严重优先级的整改措施 |
| W2 | 重要 | 此要求对于构建稳健的合规计划十分重要。虽然它并非最关键的要求,但未能满足会留下重大差距,审计师和监管机构会发现这些差距。这些要求通常是证明整体合规体系有效性所必需的。 | 如果评分低于 3 → 生成一项高优先级的整改措施 |
| W1 | 支持性 | 此要求有助于提升整体合规成熟度,但不太可能成为执法行动的重点。满足此要求表明组织采取了成熟、全面的方法。这些通常是最佳实践建议或支持性活动。 | 如果评分低于 3 → 生成一项中优先级的整改措施 |
Score = (Σ (question_score × question_weight)) / (Σ (max_score × question_weight)) × 100。每个章节也有各自的子评分,计算方式相同,但仅限于该章节内的问题。总体评分在结果页面上以百分比圆环显示,并采用颜色标识:绿色(≥80%)、琥珀色(50-79%)、红色(<50%)。
结果页面
提交评估后,结果页面会呈现以下内容:
- 总体评分环:一个圆形进度指示器,以百分比显示加权后的总体合规评分。圆环采用颜色标识:80% 及以上为绿色,50-79% 为琥珀色,低于 50% 为红色。圆环中心显示具体的评分数值。
- 章节明细:以条形图或表格显示八个章节各自的评分。低于 50% 的章节以红色突出显示,介于 50% 和 79% 之间的以琥珀色显示,达到或高于 80% 的以绿色显示。通过这一明细,您可以快速识别哪些合规领域最需要关注。
- 自动生成整改计划:系统会根据评估结果自动生成整改路线图。每个评分低于 3(已定义并实施)的问题都会生成一项整改措施。每项措施的优先级由问题的权重决定(W3 → 严重,W2 → 高,W1 → 中)。整改计划包含具体的条款引用、差距描述以及建议的整改措施。有关管理所生成计划的详细信息,请参阅整改路线图帮助文章。
备注字段
每个问题都包含一个可选的备注字段(最多 2,000 个字符)。您可以使用此字段记录:
- 支持您评分的证据(例如:“参见内部策略文档 AI-GOV-003,已于 2025 年 11 月 15 日批准”)
- 计划中的改进(例如:“数据治理框架草稿正在审核中,预计于 2026 年第一季度完成”)
- 背景说明(例如:“N/A:此系统不处理个人数据”)
- 对外部认证或审计报告的引用
这些备注会包含在评估导出文件中,在监管审计和管理评审期间具有极高的价值。