Navegação autônoma local: estudo empírico sobre o ajuste de modelos de linguagem-visão compactos para o uso de interfaces gráficas

dc.contributor.advisorOliveira, Luiz Affonso Henderson Guedes de
dc.contributor.advisor-co1Prolo, Carlos Augusto
dc.contributor.authorRodrigues, Thiago Fernandes Pinheiro de Medeiros
dc.contributor.referees1Santos, Breno Santana
dc.date.accessioned2026-07-16T18:19:49Z
dc.date.issued2026-07-02
dc.description.abstractThe autonomous automation of graphical user interfaces (GUIs) by computer use agents (CUAs) is dominated by large models, whose dependence on large-scale infrastructure imposes cost, latency, and privacy barriers. These barriers motivate interest in compact agents executable on consumer hardware, but the appropriate training techniques for this scale range and their main bottlenecks remain poorly characterized. Given this, this work empirically investigates whether reinforcement learning fine-tuning improves the performance of a compact CUA, in the four-billion-parameter range, trained exclusively under commercial hardware constraints. To this end, a vision-language model (VLM) from the Qwen3-VL family is fine-tuned on the AgentNet dataset through reinforcement learning (RL), adopting the Group Relative Sequence Policy Optimization (GSPO) algorithm under an off-policy regime, utilizing single-step episodes and a multi-criteria reward function. The resulting model is evaluated on the ScreenSpot-Pro and OSWorld-Verified benchmarks in a controlled comparison with the equivalent base network. The results reveal a consistent gain in spatial grounding, with overall accuracy improving from 33.7% to 38.7%, primarily concentrated in the localization of textual elements. In contrast, a slight regression in long- horizon agentic performance is observed, dropping from 15.1% to 11.3%, predominantly attributed to an under-termination failure rather than a loss of perceptual or interface manipulation capabilities. An analysis of internal metrics associates this behavior with the scarce representation of the termination action and the short training duration, indications reinforced by a preliminary training phase that demonstrates the feasibility of a calibrated termination policy when this action receives sufficient representation. It is concluded that the reinforcement alignment strategy is structurally viable for compact architectures and highly amenable to optimization, providing a documented empirical baseline for future investigations into local CUAs.
dc.description.resumoA automação autônoma de interfaces gráficas de usuário (GUIs) por agentes de uso de computador (CUAs, do inglês Computer Use Agents) é dominada por modelos de grande porte, cuja dependência de infraestrutura de larga escala impõe barreiras de custo, latência e privacidade. Essas barreiras motivam o interesse por agentes compactos, executáveis em hardware de consumo, mas as técnicas de treinamento adequadas a essa faixa de escala e seus principais gargalos permanecem pouco caracterizados. Diante disso, este trabalho investiga empiricamente se o ajuste fino por aprendizado por reforço melhora o desempenho de um CUA compacto, na faixa de quatro bilhões de parâmetros, treinado exclusivamente sob restrições de hardware comercial. Para tanto, ajusta-se um modelo de visão e linguagem (VLM) da família Qwen3-VL sobre o conjunto de dados AgentNet, por meio de aprendizado por reforço (RL), adotando o algoritmo de otimização de política de sequência relativa ao grupo (GSPO) sob regime off-policy, com episódios de passo único e uma função de recompensa multicritério. O modelo resultante é avaliado nos benchmarks ScreenSpot-Pro e OSWorld-Verified, em comparação controlada com a rede base equivalente. Os resultados revelam um ganho consistente em ancoramento espacial (grounding), com a acurácia geral evoluindo de 33,7% para 38,7%, concentrado na localização de elementos textuais. Em contraste, observa-se uma leve regressão no desempenho agêntico de horizonte longo, de 15,1% para 11,3%, atribuída predominantemente a uma falha de sub-terminação, e não à perda de capacidade perceptiva ou de manipulação da interface. A análise das métricas internas associa esse comportamento à escassa representação da ação de encerramento e à curta duração do treino, indícios reforçados por um treino preliminar que demonstra a viabilidade de uma política de terminação calibrada quando essa ação recebe representação suficiente. Conclui-se que a estratégia de alinhamento por reforço é estruturalmente viável para arquiteturas compactas e amplamente suscetível a otimizações, oferecendo um referencial empírico documentado para investigações futuras sobre CUAs locais.
dc.identifier.citationRODRIGUES, Thiago Fernandes Pinheiro de Medeiros. Navegação autônoma local: estudo empírico sobre o ajuste de modelos de linguagem-visão compactos para o uso de interfaces gráficas. 2026. 80 f. Trabalho de Conclusão de Curso (Graduação em Engenharia da Computação) - Departamento de Engenharia de Computação e Automação, Universidade Federal do Rio Grande do Norte, Natal, 2026.
dc.identifier.urihttps://repositorio.ufrn.br/handle/123456789/69002
dc.language.isopt_BR
dc.publisherUniversidade Federal do Rio Grande do Norte
dc.publisher.countryBrazil
dc.publisher.departmentEngenharia de Computação e Automação
dc.publisher.initialsUFRN
dc.publisher.programEngenharia de Computação
dc.rightsAttribution 3.0 Brazilen
dc.rights.urihttp://creativecommons.org/licenses/by/3.0/br/
dc.subjectAgentes de uso de computador
dc.subjectAprendizado por reforço
dc.subjectModelos multimodais
dc.subjectModelos pequenos
dc.subjectInterface gŕafica de usuário.
dc.titleNavegação autônoma local: estudo empírico sobre o ajuste de modelos de linguagem-visão compactos para o uso de interfaces gráficas
dc.typebachelorThesis

Files

Original bundle

Now showing 1 - 1 of 1
Loading...
Thumbnail Image
Name:
TCC_EngComp_UFRN_2026_1-6.pdf
Size:
940.42 KB
Format:
Adobe Portable Document Format
Loading...
Thumbnail Image
Download

License bundle

Now showing 1 - 1 of 1
Loading...
Thumbnail Image
Name:
license.txt
Size:
1.53 KB
Format:
Item-specific license agreed upon to submission
Loading...
Thumbnail Image
Download