Treinamento consciente de quantização vetorial evolutiva: um método adaptativo para compactar modelos de aprendizado de máquina
| dc.contributor.advisor | Silva, Ivanovitch Medeiros Dantas da | |
| dc.contributor.advisor-co1 | Costa, Daniel Gouveia | pt_BR |
| dc.contributor.advisor-co1ID | https://orcid.org/0000-0003-3988-8476 | |
| dc.contributor.advisor-co1Lattes | http://lattes.cnpq.br/0200709054904002 | |
| dc.contributor.advisorID | https://orcid.org/0000-0002-0116-6489 | |
| dc.contributor.advisorLattes | http://lattes.cnpq.br/3608440944832201 | |
| dc.contributor.author | Flores, Thommas Kevin Sales | pt_BR |
| dc.contributor.authorID | https://orcid.org/0000-0003-2808-8529 | |
| dc.contributor.authorLattes | http://lattes.cnpq.br/0630479458408181 | |
| dc.contributor.referees1 | Vieira, Tiago Figueiredo | pt_BR |
| dc.contributor.referees1Lattes | http://lattes.cnpq.br/8601011832053651 | |
| dc.contributor.referees2 | Martins, Allan de Medeiros | |
| dc.contributor.referees2ID | https://orcid.org/0000-0002-9486-4509 | |
| dc.contributor.referees2Lattes | http://lattes.cnpq.br/4402694969508077 | |
| dc.contributor.referees3 | Villanueva, Juan Moisés Mauricio | |
| dc.contributor.referees3ID | https://orcid.org/0000-0002-8760-9390 | |
| dc.contributor.referees3Lattes | http://lattes.cnpq.br/1715030763709959 | |
| dc.contributor.referees4 | Oliveira, Luiz Affonso Henderson Guedes de | |
| dc.contributor.referees4ID | https://orcid.org/0000-0003-2690-1563 | |
| dc.contributor.referees4Lattes | http://lattes.cnpq.br/7987212907837941 | |
| dc.date.accessioned | 2026-07-28T21:35:56Z | |
| dc.date.issued | 2026-02-06 | |
| dc.description.abstract | The consolidation of Large Language Models poses significant challenges to their deployment on edge devices, as the reliance on cloud-based infrastructures compromises data privacy, increases latency, and limits critical applications in scenarios with unstable connectivity. Traditional compression techniques, predominantly applied after training, prove inadequate in this context, as they may degrade model performance or rely on opaque execution pipelines, hindering the analysis and verification of system behavior. In response to these challenges, this thesis proposes Evolving Vector Quantization-Aware Training (EVQAT), whose central principle consists of integrating compression directly into the learning process. In this approach, quantization is no longer treated as a post-training step but rather as an adaptive mechanism during training, allowing the transformations imposed on model parameters to be explicitly controlled and analyzed. mThe methodology is grounded in evolutionary vector quantization theory by treating the weights of the language model as continuous data streams, enabling incremental clustering algorithms such as AutoCloud, Mean-Shift, and Affinity Propagation to dynamically adjust the codebooks in synchrony with the optimization of high-dimensional parameters, thereby enabling model compression with explicit control over quantization error. The integration of codebook evolution into the training process ensures that the partitioning of the vector space follows the learning dynamics, preserving relevant statistical properties and reducing the impact of quantization noise. This characteristic makes EVQAT suitable for quantizationsensitive architectures such as Transformers, extending its applicability from multilayer neural networks to generative language models under strict memory and computational constraints. The proposed approach is evaluated across multiple experimental scenarios, including training without quantization, quantization-aware training using evolutionary vector quantization and 8-bit integer (INT8) representations, as well as post-training quantization under the same variants, with deployments on microcontroller-based platforms. In this context, auditability is achieved through transparent access to model parameters, including the vocabulary, the weights of each hidden layer, and the attention mechanisms. As a result, the methodology enables the automatic generation of standard, self-contained C++ code, with real-time inference capabilities and direct execution on diverse hardware architectures, without reliance on third-party libraries or operating systems, ensuring explainability at the levels of training, model, and execution, as well as interoperability across platforms. | |
| dc.description.resumo | A consolidação dos Grandes Modelos de Linguagem impõem desafios relevantes à sua implantação em dispositivos de borda, uma vez que a dependência de infraestruturas em nuvem compromete a privacidade dos dados, aumenta a latência e limita aplicações críticas em cenários com conectividade instável. As técnicas tradicionais de compressão, predominantemente aplicadas após o treinamento, mostram-se inadequadas nesse contexto, pois podem degradar o desempenho dos modelos ou dependem de cadeias de execução opacas, dificultando a análise e a verificação do comportamento do sistema. Diante desse cenário, esta tese propõe o Treinamento Consciente de Quantização Vetorial Evolutiva (EVQAT), cujo princípio central consiste em integrar a compressão ao próprio processo de aprendizado. Nessa abordagem, a quantização deixa de ser uma etapa posterior e passa a atuar como um mecanismo adaptativo durante o treinamento, permitindo que as transformações impostas aos parâmetros do modelo sejam explicitamente controladas e analisadas. A metodologia baseia-se na teoria de quantização vetorial evolutiva ao tratar os pesos do modelo de linguagem como fluxos contínuos de dados (data streams), possibilitando que algoritmos de agrupamento incremental, como AutoCloud, Mean-Shift e Affinity Propagation, ajustem dinamicamente os codebooks em sincronia com a otimização dos parâmetros de alta dimensão, viabilizando a compressão do modelo com controle explícito do erro de quantização. A integração da evolução dos codebooks ao treinamento assegura que o particionamento do espaço vetorial acompanhe a dinâmica do aprendizado, preservando propriedades estatísticas relevantes e reduzindo o impacto do ruído de quantização. Essa característica torna o EVQAT adequado para arquiteturas sensíveis à quantização, como os Transformers, ampliando sua aplicabilidade desde redes neurais multicamadas até modelos de linguagem generativos sob restrições de memória e computação. A proposta é avaliada em diferentes cenários experimentais, incluindo treinamento sem quantização, treinamento consciente de quantização nas modalidades vetorial evolutiva e inteiros de 8 bits (INT8), bem como quantização pós-treinamento nas mesmas variantes, com implantações em plataformas microcontroladas. Nesse contexto, a auditabilidade é devido a transparência no acesso aos parâmetros do modelo, como vocabulário, pesos de cada camada oculta e de atenção. Como resultado, a metodologia permite a geração automática de código C++ padrão e autossuficiente, com fluxo de inferência em tempo real e executável diretamente em diferentes arquiteturas de hardware, sem dependência de bibliotecas de terceiros ou sistemas operacionais, assegurando explicabilidade nos níveis do treinamento, do modelo e da execução, bem como interoperabilidade entre plataformas. | |
| dc.description.sponsorship | Coordenação de Aperfeiçoamento de Pessoal de Nível Superior - CAPES | |
| dc.description.sponsorship | Conselho Nacional de Desenvolvimento Científico e Tecnológico - CNPq | |
| dc.identifier.citation | FLORES, Thommas Kevin Sales. Treinamento consciente de quantização vetorial evolutiva: um método adaptativo para compactar modelos de aprendizado de máquina. Orientador: Dr. Ivanovitch Medeiros Dantas da Silva. 2026. 152f. Tese (Doutorado em Engenharia Elétrica e de Computação) - Centro de Tecnologia, Universidade Federal do Rio Grande do Norte, Natal, 2026. | |
| dc.identifier.uri | https://repositorio.ufrn.br/handle/123456789/69366 | |
| dc.language.iso | pt_BR | |
| dc.publisher | Universidade Federal do Rio Grande do Norte | |
| dc.publisher.country | BR | pt_BR |
| dc.publisher.initials | UFRN | pt_BR |
| dc.publisher.program | PROGRAMA DE PÓS-GRADUAÇÃO EM ENGENHARIA ELÉTRICA E DE COMPUTAÇÃO | pt_BR |
| dc.rights | Acesso Aberto | pt_BR |
| dc.subject | Sistemas embarcados | |
| dc.subject | TinyML | |
| dc.subject | Treinamento Consciente de Quantização | |
| dc.subject | Quantização Vetorial Evolutiva | |
| dc.subject.cnpq | ENGENHARIAS::ENGENHARIA ELETRICA | |
| dc.title | Treinamento consciente de quantização vetorial evolutiva: um método adaptativo para compactar modelos de aprendizado de máquina | |
| dc.type | doctoralThesis | pt_BR |
Files
Original bundle
1 - 1 of 1
Loading...
- Name:
- Treinamentoconscientequantizacao_Flores_2026.pdf
- Size:
- 40.7 MB
- Format:
- Adobe Portable Document Format
Loading...
