O crescimento exponencial dos dados não estruturados transformou os repositórios de Big Data em ambientes complexos e desorganizados conhecidos como pântanos de dados. Nesse contexto, a catalogação manual de metadados torna-se impraticável devido ao volume e à diversidade das informações, comprometendo a governança de dados, a segurança e a conformidade regulatória. Este estudo propõe um modelo de arquitetura híbrida baseado em Inteligência Artificial para o enriquecimento automático de metadados, integrando Processamento de Linguagem Natural (PLN) e Visão Computacional para analisar documentos textuais e baseados em imagens. A solução atua de forma proativa durante a ingestão de dados e de forma reativa em repositórios legados, promovendo classificação, rastreabilidade e organização automatizadas. A metodologia baseia-se em uma revisão de literatura e análise conceitual da automação de metadados, do processamento distribuído e da orquestração de pipelines. Como resultado, o modelo proposto reduz as limitações associadas à curadoria manual, fortalece as práticas de governança de dados e melhora o ciclo de vida analítico de ambientes orientados por dados. Além disso, o modelo contribui para a escalabilidade, a eficiência operacional e a gestão segura da informação, apoiando as organizações na extração de maior valor de grandes volumes de dados heterogêneos.
Comissão Organizadora
Gabriel Felipe Cotta Cirino
Francisco Paletta
Victoria Siqueira Pereira
Mariane Alves Antunes
Rodrigo Garcia
Victor Barros
Karina Satie kawashita
Comissão Científica