Abstract
Este artigo objetiva apresentar o modelo pré-treinado Bidirectional Encoder Representations from Transformers (BERT) Multilingue Kikongo (KmBERT), criado no âmbito do projeto de Processamento de Linguagem Natural (PLN) Kicongo. KmBERT é uma variante multilingue do BERT (mBERT). Embora mBERT integre cerca de 104 idiomas, quase todas são línguas de muitos recursos. A maioria das línguas africanas, como o Kicongo, são de poucos recursos, principal razão de exclusão em modelos existentes. Assim, a integração destas em modelos de linguagem representa um desafio bastante árduo. Recentemente têm emergido algumas iniciativas africanas, mas ainda sem grande impacto, por abrangerem poucas línguas. KmBERT foi desenvolvido no âmbito do reforço de soluções africanas para superação do déficit existente, no contexto de apoiar na promoção da inclusão digital linguística, valorização, resgate e preservação do patrimônio linguístico e cultural de Angola. Kicongo é morfologicamente riquíssima. Falada por cerca de 11 milhões de pessoas, com maior penetração na região central da África, majoritariamente nas regiões costeiras ao sul do rio Congo (e.g. Angola, República Democrática do Congo, República do Congo, Gabão) e em vários outros países no mundo. A abordagem adotada é composta pela fase de pré-processamento de texto, representação vetorial de palavras, testes do modelo e avaliação de resultados. As tarefas de classificação de texto, análise morfossintática e sumarização de texto foram aplicadas à avaliação do desempenho, utilizando as métricas padrão, como acurácia, precisão, revocação, pontuação F1 e matriz de confusão. A acurácia obtida foi de 97%, bastante competitiva comparada a modelos africanos e línguas com muitos recursos.