Aprendizagem profunda aplicada à classificação e avaliação do comportamento do Sars-CoV-2
| Author | Azevedo, Karolayne Santos de | |
|---|---|---|
| Advisor | Fernandes, Marcelo Augusto Costa | |
| Publisher | Universidade Federal do Rio Grande do Norte | |
| Date | 2022-08-19 | |
| Keywords | Sars-CoV-2 Classificação viral Aprendizagem profunda Variantes | |
| Citation | ||
| Abstract | Pertencente à família de vírus Coronaviridae, o SARS-CoV-2 (Severe Acute Respiratory Syndrome Coronavirus 2), é um vírus envelopado de RNA e fita simples de sentido positivo que contém quase 30.000 pares de base (base-pair - bp). Vírus de RNA tendem a sofrer mais modificações do que os vírus de DNA. Assim, quando um vírus está circulando amplamente numa população e ocasionando muitas infecções, a probabilidade de seu genoma sofrer modificações aumenta, podendo afetar negativamente algumas de suas propriedades, tornando-se mais transmissíveis e/ou ainda mais letais. Dentro desse contexto, este trabalho propõe uma ferramenta, baseada em aprendizado de máquina, na qual faz uso de uma rede neural convolucional (Convolutional Neural Network - CNN) profunda de uma dimensão (1D), destinada à classificação. Como entrada, foram utilizadas amostras genômicas completas de DNAc (DNA complementar), cujo tamanho varia entre 26.342 e 31.029 bp de comprimento. Ao contrário da maioria das abordagens apresentadas na literatura, os resultados obtidos por esta ferramenta, que envolve a classificação do vírus, da mesma família, revelam valores altos para as métricas de desempenho, mostrando-se mais confiáveis se comparados com os trabalhos discutidos no estado da arte. Posteriormente a arquitetura foi utilizada para verificar o comportamento e evolução das sequências genômicas das principais variantes de preocupação (alpha, beta, gamma e delta) tendo em vista sua alta sensibilidade, por meio de valores de acurácia, obtidos por meio da classificação binárias dessas variantes. Para este experimento, foram utilizadas amostras genômicas do GISAID (Global Initiative on Sharing All Influenza Data - GISAID) que hospeda, também, dados epidemiológicos e clínicos referentes ao SARSCoV-2. Os testes de Anderson-Darling, Jarque-Bera e Kruskal-Wallis foram realizados a partir dos scores de alinhamento global, de cada variante a fim de obter parâmetros estatíticos. Os resultados dos testes apontam que as sequências genômicas não possuem distribuição normal para a maioria dos experimentos, indicando diferenças estatísticas e comportamentais dessas variantes com o passar do tempo. Essas análises vão de encontro com os resultados obtidos com a arquitetura deste trabalho, sinalizando a possibilidade do uso do modelo, não somente para a classificação víral, como também no acompanhamento do comportamento das variantes do SARS-CoV-2 ao longo do tempo devido à alta sensibilidade da rede. | |
| Abstract | The new BetaCoronavirus, officially named SARS-CoV-2 (Severe Acute Respiratory Syndrome Coronavirus - 2) is the virus causing COVID-19 disease. A member of the Coronaviridae family of viruses, SARS-CoV-2 is a positive-sense, single-stranded RNA enveloped virus that contains nearly 30,000 base pairs (base-pair - bp). RNA viruses tend to undergo more modifications than DNA viruses. Thus, when a virus is circulating widely in a population and causing many infections, the probability of its genome undergoing modifications increases, which may negatively affect some of its properties, becoming more transmissible and/or even more lethal. Within this context, this work offers a tool, based on machine learning, which makes use of a deep one-dimensional (1D) convolutional neural network (CNN) for the classification and comparison of viral genomes of the new SARS-CoV- 2. As input, complete genomic cDNA samples (complementary DNA) were used, whose size varies between 26,342 and 31,029 bp in length. Unlike most approaches presented in the literature, the results obtained by this tool, which involves the classification of viruses from the same family, reveal high values for the performance metrics, proving to be more reliable when compared to the works discussed in the state of art. Subsequently, the architecture was used to verify the behavior and evolution of the genomic sequences of the main variants of concern (beta, gamma and delta) having in its high sensitivity, through values of accuracy, obtained through binary classification of these variants. For this experiment, genomic data from GISAID (Global Initiative on Sharing All Influenza Data - GISAID) were used, which also hosts epidemiological and clinical data regarding SARS-CoV-2. The Anderson-Darling, Jarque-Bera and Kruskal-Wallis tests were performed based on the global knowledge scores of each group of variations in order to analyze their static behavior. The test results indicate that the genomic sequences do not have a normal distribution and do not follow the same distribution for most experiments, indicating statistical and behavioral differences in these variations. The tests of the model of an encounter with some results do not present comparisons that show the same group probability, in relatively smaller periods of time, going against the results obtained with the work architecture, presenting the possibility of using the use of classification virus, as well as tracking the behavior of SARS-CoV-2 variants over time due to the high sensitivity of the network. | |
| URI | https://repositorio.ufrn.br/handle/123456789/50820 | |
| Collections | PPGEE - Mestrado em Engenharia Elétrica e de Computação |
|---|
