Transparência verificável em modelos de IA por meio da auditoria de datasets
| Author | Chagas Filho, Cristian Soares de Souza | |
|---|---|---|
| Advisor | Falcão, Eduardo Lucena | |
| Publisher | Universidade Federal do Rio Grande do Norte | |
| Date | 2025-12-03 | |
| Keywords | Integridade de Dados Árvores de Merkle Hugging Face Auditoria de IA Cadeia de Suprimentos de ML Data Integrity Merkle Trees AI Auditing ML Supply Chain | |
| Citation | ||
| Abstract | A crescente utilização de modelos de Inteligência Artificial (IA) em aplicações críticas tem evidenciado a necessidade de mecanismos robustos para garantir a transparência e a integridade dos dados utilizados em seu treinamento. Atualmente, a ausência de verificabilidade na cadeia de suprimentos de aprendizado de máquina expõe modelos a riscos de segurança, como envenenamento de dados (data poisoning), e dificulta a auditoria externa. Este trabalho apresenta o desenvolvimento e a validação da ferramenta hf-merkle, uma biblioteca que integra estruturas criptográficas de Árvores de Merkle ao ecossistema Hugging Face Hub. A solução permite gerar provas de inclusão imutáveis para datasets, publicar essas provas automaticamente nos repositórios de modelos e realizar verificações independentes via interface de linha de comando (CLI). Os experimentos realizados demonstraram a viabilidade técnica da abordagem: embora o tempo de geração da árvore e o tamanho do arquivo de prova apresentem crescimento linear em relação ao número de arquivos, a latência para verificação de integridade mostrou-se extremamente baixa. A ferramenta contribui, assim, para a governança algorítmica, fornecendo um meio prático e descentralizado para assegurar a proveniência dos dados em pipelines de IA. | |
| Abstract | The increasing use of Artificial Intelligence (AI) models in critical applications has highlighted the need for robust mechanisms to ensure the transparency and integrity of the data used in their training. Currently, the lack of verifiability in the machine learning supply chain exposes models to security risks, such as data poisoning, and hinders external auditing. This work presents the development and validation of the hf-merkle tool, a library that integrates Merkle Tree cryptographic structures into the Hugging Face Hub ecosystem. The solution allows for the generation of immutable inclusion proofs for datasets, the automatic publication of these proofs in model repositories, and independent verification via a Command Line Interface (CLI). The experiments conducted demonstrated the technical feasibility of the approach: although the tree generation time and proof file size exhibit linear growth relative to the number of files, the latency for integrity verification proved to be extremely low. Thus, the tool contributes to algorithmic governance by providing a practical and decentralized means to ensure data provenance in AI pipelines. | |
| URI | https://repositorio.ufrn.br/handle/123456789/66578 | |
| Collections | CT - TCC - Engenharia de Computação |
|---|
