Navegação autônoma local: estudo empírico sobre o ajuste de modelos de linguagem-visão compactos para o uso de interfaces gráficas
| Author | Rodrigues, Thiago Fernandes Pinheiro de Medeiros | |
|---|---|---|
| Advisor | Oliveira, Luiz Affonso Henderson Guedes de | |
| Publisher | Universidade Federal do Rio Grande do Norte | |
| Date | 2026-07-02 | |
| Keywords | Agentes de uso de computador Aprendizado por reforço Modelos multimodais Modelos pequenos Interface gŕafica de usuário. | |
| Citation | ||
| Abstract | A automação autônoma de interfaces gráficas de usuário (GUIs) por agentes de uso de computador (CUAs, do inglês Computer Use Agents) é dominada por modelos de grande porte, cuja dependência de infraestrutura de larga escala impõe barreiras de custo, latência e privacidade. Essas barreiras motivam o interesse por agentes compactos, executáveis em hardware de consumo, mas as técnicas de treinamento adequadas a essa faixa de escala e seus principais gargalos permanecem pouco caracterizados. Diante disso, este trabalho investiga empiricamente se o ajuste fino por aprendizado por reforço melhora o desempenho de um CUA compacto, na faixa de quatro bilhões de parâmetros, treinado exclusivamente sob restrições de hardware comercial. Para tanto, ajusta-se um modelo de visão e linguagem (VLM) da família Qwen3-VL sobre o conjunto de dados AgentNet, por meio de aprendizado por reforço (RL), adotando o algoritmo de otimização de política de sequência relativa ao grupo (GSPO) sob regime off-policy, com episódios de passo único e uma função de recompensa multicritério. O modelo resultante é avaliado nos benchmarks ScreenSpot-Pro e OSWorld-Verified, em comparação controlada com a rede base equivalente. Os resultados revelam um ganho consistente em ancoramento espacial (grounding), com a acurácia geral evoluindo de 33,7% para 38,7%, concentrado na localização de elementos textuais. Em contraste, observa-se uma leve regressão no desempenho agêntico de horizonte longo, de 15,1% para 11,3%, atribuída predominantemente a uma falha de sub-terminação, e não à perda de capacidade perceptiva ou de manipulação da interface. A análise das métricas internas associa esse comportamento à escassa representação da ação de encerramento e à curta duração do treino, indícios reforçados por um treino preliminar que demonstra a viabilidade de uma política de terminação calibrada quando essa ação recebe representação suficiente. Conclui-se que a estratégia de alinhamento por reforço é estruturalmente viável para arquiteturas compactas e amplamente suscetível a otimizações, oferecendo um referencial empírico documentado para investigações futuras sobre CUAs locais. | |
| Abstract | The autonomous automation of graphical user interfaces (GUIs) by computer use agents (CUAs) is dominated by large models, whose dependence on large-scale infrastructure imposes cost, latency, and privacy barriers. These barriers motivate interest in compact agents executable on consumer hardware, but the appropriate training techniques for this scale range and their main bottlenecks remain poorly characterized. Given this, this work empirically investigates whether reinforcement learning fine-tuning improves the performance of a compact CUA, in the four-billion-parameter range, trained exclusively under commercial hardware constraints. To this end, a vision-language model (VLM) from the Qwen3-VL family is fine-tuned on the AgentNet dataset through reinforcement learning (RL), adopting the Group Relative Sequence Policy Optimization (GSPO) algorithm under an off-policy regime, utilizing single-step episodes and a multi-criteria reward function. The resulting model is evaluated on the ScreenSpot-Pro and OSWorld-Verified benchmarks in a controlled comparison with the equivalent base network. The results reveal a consistent gain in spatial grounding, with overall accuracy improving from 33.7% to 38.7%, primarily concentrated in the localization of textual elements. In contrast, a slight regression in long- horizon agentic performance is observed, dropping from 15.1% to 11.3%, predominantly attributed to an under-termination failure rather than a loss of perceptual or interface manipulation capabilities. An analysis of internal metrics associates this behavior with the scarce representation of the termination action and the short training duration, indications reinforced by a preliminary training phase that demonstrates the feasibility of a calibrated termination policy when this action receives sufficient representation. It is concluded that the reinforcement alignment strategy is structurally viable for compact architectures and highly amenable to optimization, providing a documented empirical baseline for future investigations into local CUAs. | |
| URI | https://repositorio.ufrn.br/handle/123456789/69002 | |
| Collections | CT - TCC - Engenharia de Computação |
|---|
