数据治理:数据集与 Art. 10 合规
EU AI Act 第 10 条对用于训练、验证和测试高风险 AI 系统的数据规定了严格要求。提供者必须实施适当的数据治理和管理实践,检查数据集是否存在偏差,确保数据在统计上具有相关性和代表性,并遵守个人数据保护要求。Venvera 中的数据治理模块提供了一个全面的登记册,用于记录数据集、跟踪其质量、评估偏差以及管理隐私方面的考量。本文将介绍该模块的每一项功能。
列表视图
在侧边栏中进入 EU AI Act → 数据治理。列表视图以分页表格的形式显示所有已登记的数据集,并按最后更新日期排序。每一行显示数据集名称、关联的 AI 系统、类型徽章、大小、质量评分、偏差评估状态,以及数据集是否包含个人数据。
搜索栏使用不区分大小写的部分匹配,按名称和描述筛选数据集。这有助于查找与特定 AI 系统、领域或数据类型相关的数据集。例如,搜索“客户”会匹配“客户交易训练数据”和“客户反馈验证集”。
使用类型下拉菜单按数据集类型筛选:
- 训练:用于训练 AI 模型的数据。这通常是规模最大的数据集,对于符合 Art. 10 也最为关键。训练数据必须具有相关性和代表性,且无错误、完整。
- 验证:在开发期间用于调整超参数和评估模型性能的数据。验证数据应独立于训练数据,以避免过拟合。
- 测试:在部署之前用于最终评估模型性能的数据。测试数据应能代表真实世界的条件,并且不得在训练或验证期间使用过。
- 运营:AI 系统在实际运行期间处理的数据。跟踪运营数据对于上市后监测和检测数据漂移非常重要。
使用偏差评估筛选器,根据偏差评估所处的状态识别数据集:
- 未开始:尚未对该数据集启动偏差评估。高风险 AI 系统的数据集应在部署之前完成偏差评估。
- 进行中:偏差评估正在进行。评估人员已开始记录评估结果,但尚未完成评估。
- 已完成:偏差评估已完成并记录在案。数据集记录包含评估结果以及已采取的任何缓解行动。
创建新数据集
点击+ 添加数据集打开创建表单。填写所有必填字段:
| 字段 | 类型 | 是否必填 | 说明 |
|---|---|---|---|
| 名称 | 文本输入框 | 必填 | 数据集的描述性名称。名称应清楚标明数据内容、相关的 AI 系统及其用途。例如:“信用风险模型:训练数据集 v3.2(2024 年客户交易)”。最多 300 个字符。同一 AI 系统内的名称应保持唯一,以免混淆。 |
| 描述 | 多行文本框 | 可选 | 对数据集内容、来源和特征的详细描述。请写明数据来源、所涵盖的时间段、记录数量、特征集以及已应用的任何预处理步骤。该描述是任何审查此数据集的人员的主要参考资料,并会包含在技术文档导出中。最多 5,000 个字符。 |
| AI 系统 | 下拉列表 | 可选 | 选择使用此数据集的 AI 系统。下拉列表会列出您清单中的所有 AI 系统。将数据集关联到 AI 系统后,系统详情页面即可显示相关数据集,并支持完整性跟踪。一个数据集只能关联一个 AI 系统;如果同一数据被多个系统使用,请为每个系统分别创建数据集记录。 |
| 类型 | 下拉列表 | 可选 | 选择数据集类型:训练、验证、测试或运营。类型决定了适用于此数据集的合规检查和建议。训练数据集会触发 Art. 10 下最全面的要求。 |
| 大小 | 文本输入框 | 可选 | 以便于阅读的格式表示的数据集大小(例如“2.4 GB”“120 万条记录”“500,000 行 × 42 个特征”)。这是一个自由文本字段,可以填写对您的场景最有意义的任何大小描述。建议同时填写存储大小和记录数。 |
| 个人数据 | 复选框 | 可选 | 如果数据集包含 GDPR(Regulation (EU) 2016/679)所定义的个人数据,请勾选此复选框。勾选后,其他与隐私相关的字段(包括 GDPR 法律依据)随之适用。包含个人数据的数据集需同时接受 EU AI Act 和 GDPR 下的额外审查,并且在数据最小化、目的限制和存储限制方面必须格外谨慎地处理。 |
| GDPR 法律依据 | 下拉列表 | 可选 | 如果数据集包含个人数据,请选择处理该数据所依据的 GDPR 法律依据。选项包括:
|
数据集详情页面
在列表视图中点击某个数据集,即可打开其详情页面,该页面分为以下几个部分:
数据集信息
顶部区域显示创建时填写的所有字段:名称、描述、关联的 AI 系统(可点击的链接)、类型、大小和时间戳。这为审查该数据集记录的任何人员提供了快速参考。
隐私卡片
如果数据集被标记为包含个人数据,页面会显示一张专门的隐私卡片。该卡片显示:
- 个人数据标识:一个醒目的徽章,用于确认数据集包含个人数据。
- GDPR 法律依据:所选的法律依据,并附有对其含义的简要说明。
- 数据保护注意事项:根据数据集类型和法律依据自动生成的建议。例如,如果数据集是以“同意”为法律依据的训练数据集,系统会建议您核实该同意是否涵盖 AI 训练用途、实施数据最小化,并设定保留期限。
- 与 GDPR 模块的交叉引用:如果您的组织使用 Venvera 的 GDPR 处理活动模块,页面会提供指向相关处理活动记录的链接,以便进行一体化的合规管理。
偏差评估
偏差评估部分是对数据集进行的结构化评估,用于识别可能影响 AI 系统公平性和非歧视性的潜在偏差。该部分包括:
- 状态:未开始、进行中或已完成。请随着评估的推进更新此状态。
- 评估备注:一个富文本字段,用于记录偏差评估结果、所用方法、所检查的受保护特征、所采用的统计度量以及已采取的缓解行动。请注明所使用的具体工具或技术(例如人口统计均等分析、均等化几率测试、差异影响比率)。
- 已识别的偏差:对检测到的任何偏差、其潜在影响以及已实施的缓解措施的总结。
- 缓解行动:为处理已识别偏差而采取的步骤记录(例如重新采样、重新加权、数据增强、移除代理变量)。
质量评分
质量评分是一个百分比(0-100%),反映数据集的整体数据质量。该评分以按颜色区分的进度条形式显示:
- 绿色(≥80%):数据集达到或超过数据质量要求。数据记录完善、错误极少、覆盖全面,并且偏差已经过评估和缓解。
- 琥珀色(≥50% 且 <80%):数据集仍有改进空间。存在一些质量问题,但并不严重。请查看数据集描述和偏差评估,找出需要改进的方面。
- 红色(<50%):数据集存在严重的质量隐患。在完整性、准确性、偏差或文档记录方面存在重大问题。在将该数据集用于高风险 AI 系统的训练或验证之前,请先解决这些问题。
质量评分可以根据您的数据质量评估手动设置;如果已集成自动化数据剖析工具,也可以参考这些工具的结果来确定。在改进数据集并解决已识别的问题后,请相应更新评分。