A Knowledge Graph-Based approach for modeling legislative texts: representation and document similarity analysis

Author Oliveira, Gisliany Lillian Alves de
Advisor

Silva, Ivanovitch Medeiros Dantas da

Publisher

Universidade Federal do Rio Grande do Norte

Date

2025-08-29

Keywords

Textos legislativos

Processamento de linguagem natural

Grafos de conhecimento

IA baseada em grafos

Grandes modelos de linguagem

Citation
Abstract

A principal tarefa do Poder Legislativo — a criação de leis — depende de um processo complexo e exigente, no qual novas propostas devem ser analisadas, debatidas e revisadas à luz da legislação existente. Essas atividades frequentemente demandam grande esforço humano devido à linguagem técnica, ampla extensão textual e interdependência dos textos jurídicos. Ao mesmo tempo, essas características representam uma oportunidade tangível para a Inteligência Artificial (IA), especialmente por meio da integração do Processamento de Linguagem Natural (PLN) e representações estruturadas de dados. Com o objetivo de modelar documentos legislativos de forma a preservar sua rica semântica estrutural, este trabalho propõe uma abordagem para transformar textos legislativos em Grafos de Conhecimento (GCs) especializados para o domínio, capturando sua organização hierárquica inerente. O método proposto, baseado no padrão LexML — um esquema XML brasileiro para documentos jurídicos —, extrai relações estruturais explícitas (e.g., artigos, parágrafos, incisos) e as enriquece com entidades e relações contextuais extraídas por um Grande Modelo de Linguagem (GML). Os GCs resultantes, armazenados em um banco de dados Neo4j, capturam tanto a topologia interna dos textos jurídicos quanto suas nuances semânticas, permitindo representações estruturadas que viabilizam análises mais significativas do que o texto bruto não estruturado. Para avaliar a eficácia dessa abordagem, foram conduzidos experimentos comparativos em tarefas de similaridade entre documentos, componente essencial dos fluxos de trabalho legislativos. Três cenários foram avaliados: (i) uma baseline apenas com uso de texto, aplicando embeddings de sentenças baseados em BERT e calculadas pela média entre seções do documento; e (ii) KGs estruturais, representados por embeddings gerados via FastRP e GraphSAGE; e (iii) KGs enriquecidos contextualmente também representados por embeddings do FastRP e GraphSAGE. Resultados obtidos com proposições legislativas da Assembleia Legislativa do Rio Grande do Norte (ALRN) mostraram que, embora o baseline tenha alcançado maior precisão, recall e escores F1, as representações baseadas em GCs forneceram ideias interpretáveis e apoiadas na estrutura, complementando modelos puramente textuais. O enriquecimento contextual melhorou o desempenho do FastRP em relação aos grafos apenas estruturais, enquanto o GraphSAGE obteve seus melhores resultados com representações puramente estruturais, sugerindo que as relações derivadas do LLM podem ter introduzido ruído semântico para esse modelo de grafos. Embora os GCs fossem inerentemente heterogêneos, algoritmos para grafos homogêneos foram aplicados por simplicidade, o que pode ter limitado o desempenho. Apesar disso, os resultados demonstram a viabilidade de converter documentos legislativos em GCs, e a inclusão de informações estruturais nos embeddings foi alcançada, mostrando potencial para melhorias futuras por meio de modelos heterogêneos, estratégias avançadas de pool- ing ou pré-treinamento auto-supervisionado. Ao unir PLN e IA baseada em grafos, este trabalho avança as abordagens para modelagem de documentos legais, oferecendo um pipeline para análise de similaridade documental e melhorando a eficiência do processo legislativo.

Abstract

The most prominent task of the Legislative Branch — lawmaking — depends on a complex and demanding process in which new proposals must be examined, debated, and revised in light of existing legislation. These activities are often labor-intensive for humans due to the technical language, substantial length, and interdependence of legal texts. At the same time, these characteristics present a tangible opportunity for Artificial Intelligence (AI), particularly through the integration of Natural Language Processing (NLP) and structured data representations. Aiming to model legislative documents in a way that preserves their rich structural semantics, this work proposes an approach for transforming legislative texts into domain-specialized Knowledge Graphs (KGs) that capture their inherent hierarchical organization. The proposed method, based on LexML standards — a Brazilian XML schema for legal documents — extracts explicit structural relationships (e.g., articles, paragraphs, items) and augments them with contextual entities and relationships extracted by a Large Language Model (LLM). The resulting KGs, stored in a Neo4j database, capture both the internal topology of legal texts and their semantic nuances, enabling structured representations that support more meaningful analysis than unstructured raw text. To assess the effectiveness of this approach, comparative experiments were conducted on document similarity tasks, a core component of legislative workflows. Three scenarios were evaluated: (i) a text-only baseline using BERT-based sentence embeddings averaged across document sections; (ii) structure-aware KGs encoded via FastRP and GraphSAGE embeddings; and (iii) contextually enriched KGs also encoded via FastRP and GraphSAGE embeddings. Results using legislative proposals from the Legislative Assembly of Rio Grande do Norte (ALRN) show that while the text-based model achieved the highest precision, recall, and F1-scores, the KG-based representations provided interpretable, structure-driven insights. Contextual enrichment improved FastRP’s performance over structure-only graphs, while GraphSAGE performed best with structure-only representations, suggesting that LLM-derived relations may have introduced semantic noise for this graph model. Although the KGs were inherently heterogeneous, homogeneous graph algorithms were applied for simplicity, which may have limited performance. Nevertheless, the results demonstrate the feasibility of converting legislative documents to KGs, and the inclusion of structural information in embeddings was achieved, demonstrating potential for future improvements via heterogeneous models, advanced pooling strategies, or self-supervised pre-training. By bridging NLP and graph-based AI, this work advances approaches for legal document modeling, offering a pipeline for document similarity analysis and improving the legislative process efficiency.

URIhttps://repositorio.ufrn.br/handle/123456789/67273
CollectionsPPGEE - Doutorado em Engenharia Elétrica e de Computação