Venvera EU AI Act 仪表板,含 AI 系统清单与风险分类
EU AI Act 仪表板(示例数据)

数据治理:数据集与 Art. 10 合规

EU AI Act 第 10 条对用于训练、验证和测试高风险 AI 系统的数据规定了严格要求。提供者必须实施适当的数据治理和管理实践,检查数据集是否存在偏差,确保数据在统计上具有相关性和代表性,并遵守个人数据保护要求。Venvera 中的数据治理模块提供了一个全面的登记册,用于记录数据集、跟踪其质量、评估偏差以及管理隐私方面的考量。本文将介绍该模块的每一项功能。

列表视图

第 1 步:打开数据集列表

在侧边栏中进入 EU AI Act → 数据治理。列表视图以分页表格的形式显示所有已登记的数据集,并按最后更新日期排序。每一行显示数据集名称、关联的 AI 系统、类型徽章、大小、质量评分、偏差评估状态,以及数据集是否包含个人数据。

第 2 步:搜索数据集

搜索栏使用不区分大小写的部分匹配,按名称和描述筛选数据集。这有助于查找与特定 AI 系统、领域或数据类型相关的数据集。例如,搜索“客户”会匹配“客户交易训练数据”和“客户反馈验证集”。

第 3 步:按类型筛选

使用类型下拉菜单按数据集类型筛选:

  • 训练:用于训练 AI 模型的数据。这通常是规模最大的数据集,对于符合 Art. 10 也最为关键。训练数据必须具有相关性和代表性,且无错误、完整。
  • 验证:在开发期间用于调整超参数和评估模型性能的数据。验证数据应独立于训练数据,以避免过拟合。
  • 测试:在部署之前用于最终评估模型性能的数据。测试数据应能代表真实世界的条件,并且不得在训练或验证期间使用过。
  • 运营:AI 系统在实际运行期间处理的数据。跟踪运营数据对于上市后监测和检测数据漂移非常重要。
第 4 步:按偏差评估状态筛选

使用偏差评估筛选器,根据偏差评估所处的状态识别数据集:

  • 未开始:尚未对该数据集启动偏差评估。高风险 AI 系统的数据集应在部署之前完成偏差评估。
  • 进行中:偏差评估正在进行。评估人员已开始记录评估结果,但尚未完成评估。
  • 已完成:偏差评估已完成并记录在案。数据集记录包含评估结果以及已采取的任何缓解行动。

创建新数据集

点击+ 添加数据集打开创建表单。填写所有必填字段:

字段类型是否必填说明
名称文本输入框必填数据集的描述性名称。名称应清楚标明数据内容、相关的 AI 系统及其用途。例如:“信用风险模型:训练数据集 v3.2(2024 年客户交易)”。最多 300 个字符。同一 AI 系统内的名称应保持唯一,以免混淆。
描述多行文本框可选对数据集内容、来源和特征的详细描述。请写明数据来源、所涵盖的时间段、记录数量、特征集以及已应用的任何预处理步骤。该描述是任何审查此数据集的人员的主要参考资料,并会包含在技术文档导出中。最多 5,000 个字符。
AI 系统下拉列表可选选择使用此数据集的 AI 系统。下拉列表会列出您清单中的所有 AI 系统。将数据集关联到 AI 系统后,系统详情页面即可显示相关数据集,并支持完整性跟踪。一个数据集只能关联一个 AI 系统;如果同一数据被多个系统使用,请为每个系统分别创建数据集记录。
类型下拉列表可选选择数据集类型:训练、验证、测试或运营。类型决定了适用于此数据集的合规检查和建议。训练数据集会触发 Art. 10 下最全面的要求。
大小文本输入框可选以便于阅读的格式表示的数据集大小(例如“2.4 GB”“120 万条记录”“500,000 行 × 42 个特征”)。这是一个自由文本字段,可以填写对您的场景最有意义的任何大小描述。建议同时填写存储大小和记录数。
个人数据复选框可选如果数据集包含 GDPR(Regulation (EU) 2016/679)所定义的个人数据,请勾选此复选框。勾选后,其他与隐私相关的字段(包括 GDPR 法律依据)随之适用。包含个人数据的数据集需同时接受 EU AI Act 和 GDPR 下的额外审查,并且在数据最小化、目的限制和存储限制方面必须格外谨慎地处理。
GDPR 法律依据下拉列表可选如果数据集包含个人数据,请选择处理该数据所依据的 GDPR 法律依据。选项包括:
  • 同意(Art. 6(1)(a)):数据主体已同意该处理。
  • 合同必要性(Art. 6(1)(b)):处理是履行与数据主体订立的合同所必需的。
  • 法律义务(Art. 6(1)(c)):处理是履行法律义务所必需的。
  • 重大利益(Art. 6(1)(d)):处理是保护重大利益所必需的。
  • 公共利益(Art. 6(1)(e)):处理是执行符合公共利益的任务所必需的。
  • 合法利益(Art. 6(1)(f)):处理是实现合法利益所必需的,并已与数据主体的权利进行权衡。
在证明符合 AI Act 的同时,该字段对于证明符合 GDPR 至关重要。如果数据集使用特殊类别数据(GDPR Art. 9),则必须记录额外的保障措施。
Art. 10 关键要求:EU AI Act 要求,训练、验证和测试数据集应当具有相关性和充分的代表性,并且鉴于预期用途,尽最大可能做到无错误且完整。数据集必须遵循适当的数据治理和管理实践,涉及以下方面:(a)相关的设计选择;(b)数据收集过程和数据来源;(c)相关的数据准备处理操作(标注、标记、清洗、更新、扩充、汇总);(d)假设的制定;(e)对所需数据的可用性、数量和适用性的评估;(f)检查可能影响健康、安全或基本权利的潜在偏差;(g)用于检测、预防和缓解潜在偏差的适当措施。

数据集详情页面

在列表视图中点击某个数据集,即可打开其详情页面,该页面分为以下几个部分:

数据集信息

顶部区域显示创建时填写的所有字段:名称、描述、关联的 AI 系统(可点击的链接)、类型、大小和时间戳。这为审查该数据集记录的任何人员提供了快速参考。

隐私卡片

如果数据集被标记为包含个人数据,页面会显示一张专门的隐私卡片。该卡片显示:

  • 个人数据标识:一个醒目的徽章,用于确认数据集包含个人数据。
  • GDPR 法律依据:所选的法律依据,并附有对其含义的简要说明。
  • 数据保护注意事项:根据数据集类型和法律依据自动生成的建议。例如,如果数据集是以“同意”为法律依据的训练数据集,系统会建议您核实该同意是否涵盖 AI 训练用途、实施数据最小化,并设定保留期限。
  • 与 GDPR 模块的交叉引用:如果您的组织使用 Venvera 的 GDPR 处理活动模块,页面会提供指向相关处理活动记录的链接,以便进行一体化的合规管理。

偏差评估

偏差评估部分是对数据集进行的结构化评估,用于识别可能影响 AI 系统公平性和非歧视性的潜在偏差。该部分包括:

  • 状态:未开始、进行中或已完成。请随着评估的推进更新此状态。
  • 评估备注:一个富文本字段,用于记录偏差评估结果、所用方法、所检查的受保护特征、所采用的统计度量以及已采取的缓解行动。请注明所使用的具体工具或技术(例如人口统计均等分析、均等化几率测试、差异影响比率)。
  • 已识别的偏差:对检测到的任何偏差、其潜在影响以及已实施的缓解措施的总结。
  • 缓解行动:为处理已识别偏差而采取的步骤记录(例如重新采样、重新加权、数据增强、移除代理变量)。
警告(训练数据中的偏差):训练数据中的偏差是 AI 系统最重大的风险之一,也是 EU AI Act 关注的重点。Art. 10(2)(f) 明确要求检查可能影响人员健康和安全、对基本权利产生负面影响或导致歧视的潜在偏差。如果未进行全面的偏差评估,无论 AI 系统的技术性能指标如何,都可能导致其不符合该法规。请全面记录您的偏差评估方法和结果。

质量评分

质量评分是一个百分比(0-100%),反映数据集的整体数据质量。该评分以按颜色区分的进度条形式显示:

  • 绿色(≥80%):数据集达到或超过数据质量要求。数据记录完善、错误极少、覆盖全面,并且偏差已经过评估和缓解。
  • 琥珀色(≥50% 且 <80%):数据集仍有改进空间。存在一些质量问题,但并不严重。请查看数据集描述和偏差评估,找出需要改进的方面。
  • 红色(<50%):数据集存在严重的质量隐患。在完整性、准确性、偏差或文档记录方面存在重大问题。在将该数据集用于高风险 AI 系统的训练或验证之前,请先解决这些问题。

质量评分可以根据您的数据质量评估手动设置;如果已集成自动化数据剖析工具,也可以参考这些工具的结果来确定。在改进数据集并解决已识别的问题后,请相应更新评分。

提示(数据集版本管理):当您对数据集进行重大更改时(例如添加新记录、移除带有偏差的特征、应用新的预处理),建议创建新的数据集记录,而不是更新现有记录。这样可以保留审计追踪,并让您能够随时间比较不同数据集版本的质量评估和偏差评估。请将所有版本关联到同一个 AI 系统,以便于查阅。