生成式AI服务合规审计框架构建——以数据来源与处理路径审查为核心
肖 樵楠
西安翻译学院
DOI: https://doi.org/10.59429/jglt.v3i4.15173
Keywords: 生成式人工智能;合规审计;数据来源;处理路径;审计框架
Abstract
生成式人工智能的快速发展对数据合规治理提出挑战,训练数据来源不透明、处理路径不可追溯等问题突出。 本文聚焦数据来源合法性与处理路径可追溯性,构建“数据来源合规性审查—处理路径可追溯性审查—合规风险评 估与整改”三阶段审计框架,将来源审查细分为来源识别、授权验证、质量评估,将路径审查细分为数据采集、预 处理、模型训练、输出生成,并设计配套指标体系与量化评分。结合国内典型服务合规现状验证框架适用性,为完 善 AI 合规审计制度提供支撑。
References
[1] IDC. 全球人工智能和生成式人工智能支出指南(2025 年 V2 版)[R]. 2025.
[2] IDC. 中国人工智能市场数据[R]. 2024.
[3] 国家互联网信息办公室. 关于发布生成式人工智能服务已备案信息的公告[R]. 2025; 新华网. 国家网信办:611 款生成式人工智能服务完成备案[N]. 2025-11-13.
[4] Stanford HAI. Foundation Model Transparency Index (FMTI)[R]. Oct. 2023, May 2024, Dec. 2025 editions.
[5] Longpre S, Mahari R, Lee A, et al. A large-scale audit of dataset licensing and attribution in AI[J]. Nature Machine Intelligence, 2024, 6: 1001-1009.
[6] The New York Times v. Microsoft Corporation et al., Case No. 1:23-cv-11195 (S.D.N.Y., filed Dec. 27, 2023).
[7] Andersen v. Stability AI Ltd. et al., Case No. 3:23-cv-00201 (N.D. Cal., filed Jan. 13, 2023).
[8] 全国人民代表大会常务委员会. 中华人民共和国数据安全法[Z]. 2021-06-10.
[9] 全国人民代表大会常务委员会. 中华人民共和国个人信息保护法[Z]. 2021-08-20.
[10] 国家互联网信息办公室等四部门. 互联网信息服务算法推荐管理规定(第 9 号令)[Z]. 2021-12-31.
[11] 国家互联网信息办公室等两部门. 互联网信息服务深度合成管理规定(第 12 号令)[Z]. 2022-11-03.
[12] 国家互联网信息办公室等七部门. 生成式人工智能服务管理暂行办法(第 15 号令)[Z]. 2023-07-10.
[13] Regulation (EU) 2024/1689 of the European Parliament and of the Council (Artificial Intelligence Act)[S]. OJ EU, 2024-07-12, Art. 10.
[14] NIST. Artificial Intelligence Risk Management Framework (AI RMF 1.0)[S]. NIST AI 100-1, 2023-01.
[15] Power M K. The Theory of Auditing[M]. 2nd ed. Houston: Scholars Book Co., 1993: 18-35.
[16] 王利明. 数据的法律属性及其民法定位[J]. 中国社会科学 , 2023(4): 94-114.
[17] Voigt P, Bussche A von dem. The EU General Data Protection Regulation (GDPR): A Practical Guide[M]. Cham: Springer, 2017: 201-220.
[18] Dziedzic A, Fan J, et al. Data Provenance via Differential Auditing[C]. IEEE DPM, 2023.
[19] Zeng Z, et al. Cognitive Tracing Data Trails: Auditing Data Provenance in Generative AI Systems[J]. Cognitive Computation, 2024, 16: 2105-2122.
[20] 人工智能生成内容模型的数字水印技术研究进展[J]. 网络与信息安全学报 , 2024, 10(1): 1-15.
[21] 赵铁军等. 人工智能模型水印研究进展[J]. 中国图象图形学报 , 2023, 28(6): 1792-1810.
[22] Zhao X, Ananth P, Li L, et al. Provable Unbiased Watermarking for Large Language Models[C]. ICLR 2024.
[23] Carlini N, Ippolito D, Jagielski M, et al. Quantifying Memorization in Neural Networks[C]. ICML, 2023.