Multi-agent reinforcement learning for inter-cell interference management in hotspots scenarios
| Author | Rêgo, Iago Diógenes do | |
|---|---|---|
| Advisor | Sousa Júnior, Vicente Angelo de | |
| Date | 2025-05-05 | |
| Keywords | Inter-cell interference Fractional frequency reuse Reinforcement learning Multi-agent Q-Learning MAB | |
| Citation | ||
| Abstract | Interferência intercelular (Inter-cell Interference - ICI) é um desafio persistente em redes móveis. Embora os padrões atuais e futuros estejam evoluindo rapidamente, o aumento constante na demanda por dados, o surgimento de novos casos de uso, a coexistência de múltiplas tecnologias e o caráter dinâmico dos ambientes urbanos intensificam o impacto da interferência no desempenho do sistema. Ademais, a ICI torna-se especialmente desafiadora em cenários com alta densidade de pontos de acesso ou com zonas de alta densidade de usuários, conhecidas como hotspots. Para mitigar os efeitos negativos da ICI, o Inter-Cell Interference Coordination foi introduzido na Release 8 do 3rd Generation Partnership Project (3GPP), sendo o Fractional Frequency Reuse (FFR) uma das técnica de ICIC mais eficazes, amplamente aplicada em redes baseadas em Orthogonal Frequency-Division Multiple Access (OFDMA), como LTE e 5G. Embora originalmente desenvolvidas para o LTE, as técnicas de FFR também se mostram adequadas para redes 5G. Embora suas configurações estáticas frequentemente falhem em se adaptar a padrões de interferência dinâmicos, sua baixa complexidade e simplicidade de implementação tornam o FFR especialmente atrativo em cenários modernos. Essas técnicas oferecem uma base sólida para estratégias adaptativas de gerenciamento de interferência, especialmente quando integradas ao Aprendizado de Máquina (ML). Esse trabalho tem o objetivo de investigar o uso de Aprendizado por Reforço (Reinforcement Learning - RL) para controlar dinamicamente múltiplos parâmetros de uma técnica de FFR em cenários caracterizados pelo surgimento inesperado de hotspots. A solução consiste em uma arquitetura hierárquica de múltiplos agentes, na qual dois agentes de RL otimizam em conjunto a alocação de banda e a classificação de usuários por meio do RSRQ threshold, sem uma relação de dependência direta no processo individual de aprendizado. A abordagem proposta é analisada quantitativamente e qualitativamente por meio do simulador de redes ns-3, utilizando um cenário composto por três estações rádio-base equipadas com antenas omnidirecionais, no qual uma fração dos usuários está confinada em hotspots. A cada intervalo de tempo pré-definido, um novo hotspot torna-se ativo, simulando um ambiente com demanda e interferência dinâmicos. Essa configuração é subdividida em dois cenários distintos, inspirados em especificações do 3GPP, representando, respectivamente, um cenário urbano denso e um cenário com grande número de dispositivos. Os resultados obtidos demonstram que há uma forte interdependência entre a classificação dos usuários (utilizando o RSRQ threshold) e a alocação de banda, evidenciando que o controle combinado desses dois parâmetros tem forte impacto no desempenho da rede. A solução proposta apresentou melhor desempenho de forma consistente, superando tanto a configuração estática quanto as soluções com agente único, nas quais apenas um dos parâmetros é ajustado dinamicamente. A solução multi-agente é capaz de explorar o espaço de ações conjuntas e convergir para a configuração mais eficaz, mesmo em cenários com alta interferência e distribuição de usuários em constante mudança, enquanto as soluções com agente único são limitadas pelo valor estático do parâmetro que não controlam. A solução proposta alcançou ganhos de vazão de até 99,4%, enquanto o controle isolado de um único parâmetro mostrou-se insuficiente em todos os casos avaliados. Outra contribuição deste trabalho foi demonstrar a flexibilidade da estrutura proposta. Seu design hierárquico permite a integração de diferentes algoritmos de aprendizado por reforço. Duas estratégias de aprendizado foram implementadas e avaliadas: Q-Learning (QL) e Multi-Armed Bandits (MAB). O QL, ao considerar um processo de aprendizado que associa as ações à diferentes estados do sistema, alcançou desempenho superior, especialmente em cenários com maior interferência. No entanto, sua implementação exigiu um esforço adicional para a definição de estados representativos, além de envolver a exploração de um número maior de pares estado-ação. Por sua vez, os agentes MAB, por serem isentos de estados e mais simples de implementar, oferecem um bom equilíbrio entre complexidade e desempenho, especialmente em ambientes com capacidade de processamento limitada. Isso evidencia que a estrutura hierárquica pode ser adaptada para atender a diferentes requisitos do sistema, equilibrando desempenho e complexidade de implementação. Esses resultados reforçam a contribuição central deste trabalho, que consiste na combinação de técnicas clássicas de ICIC com aprendizado por reforço para compor uma estratégia de mitigação de interferência flexível e de baixo overhead, capaz de se adaptar a condições de rede diversas e dinâmicas. | |
| Abstract | Inter-cell interference (ICI) remains a critical challenge in mobile networks. Although current and future standards are rapidly evolving, the constant increase in data demand, the emergence of new use cases, the coexistence of multiple technologies, and the dynamic aspect of urban environments intensifies the impact of interference on system performance. ICI becomes especially challenging in dense deployments and in scenarios with zones of high user densities, referred to as hotspots. Fractional Frequency Reuse (FFR) is a well-established technique to mitigate ICI in OFDMA-based networks such as LTE and 5G, but traditional static configurations often fail to adapt to dynamic interference patterns. This thesis proposes a dynamic interference coordination framework based on reinforcement learning, designed to enhance the adaptability and performance of FFR techniques. The solution consists of a hierarchical multi-agent architecture, where two reinforcement learning agents operate in coordination, without direct exchange of information, to jointly control the allocation of bandwidth and user classification via the RSRQ threshold. The proposed approach was evaluated through network simulations using ns-3, across two different scenarios representing dense urban environments and massive connection conditions. The results show that the proposed framework consistently outperforms static and single-agent baselines, achieving throughput gains of up to 99.4%, particularly under high-interference conditions and for low-performing users. Furthermore, its modular design allows integration of different learning strategies. While Q-Learning agents delivered the highest performance, Multi-Armed Bandit (MAB) agents achieved comparable results with significantly lower computational complexity. By combining classical ICIC techniques with reinforcement learning, this work presents a flexible and low-overhead interference mitigation strategy that can adapt to diverse and evolving network conditions. | |
| URI | https://repositorio.ufrn.br/handle/123456789/65283 | |
| Collections | PPGEE - Doutorado em Engenharia Elétrica e de Computação |
|---|
