Análise Morfossintática Utilizando HMM e Perceptron
Palavras-chave:
etiquetador, hmm, perceptron, corpus, morfossintaxeResumo
Em computação, a análise morfossintática é uma tarefa tratada dentro da área de processamento de linguagem natural e que fornece meios de determinar a classe gramatical das palavras de uma oração. Esse processo consiste em atribuir a cada palavra uma etiqueta que representa sua classe de acordo com seu contexto. Uma das dificuldades inerentes é a ambiguidade das palavras, que podem representar diferentes papéis em diferentes contextos. Essa tarefa é útil, por exemplo, na recuperação de informações de textos. O objetivo deste projeto de pesquisa é a construção de um etiquetador morfossintático que atinja alta acurácia. Um etiquetador é um software que lê um texto e atribui etiquetas para suas palavras. Acurácia é a porcentagem de palavras etiquetadas corretamente. As abordagens mais utilizadas para etiquetagem baseiam-se no treinamento supervisionado, que consiste em obter informações de um corpus etiquetado manualmente. No nosso caso o corpus usado é o Tycho Brahe. Uma abordagem bastante eficiente na desambiguação de palavras é o uso de Modelos Ocultos de Markov (HMM), que oferecem um modelo probabilístico para dizer qual a sequência mais provável de etiquetas dada uma sequência de palavras (sentença). A probabilidade de ocorrência de uma etiqueta é dada pela probabilidade dessa etiqueta estar associada à uma determinada palavra (probabilidade de emissão) multiplicada pela probabilidade dessa etiqueta ser seguida por outra(s) (probabilidade de transição). Contudo, o HMM é dependente de uma contagem densa proveniente do treinamento para que se possa estimar probabilidades coerentes, o que exige uma grande quantidade de dados anotados. Para contornar isso, implementamos o algoritmo Perceptron para treinamento do modelo, que é gradualmente alterado de acordo a etiquetagem do próprio modelo. Para cada etiqueta atribuída erroneamente decrementa-se os pesos das variáveis (emissão e transição) que conduziram ao erro e incrementa-se os daquelas que levam à etiqueta correta. Esse processo é repetido até que se atinja um nível aceitável de acertos sobre o conjunto de treinamento. A mesclagem dessas estratégias resultou em uma acurácia satisfatória de 92,42%. Trabalhos futuros incluem a construção de um novo etiquetador unindo boas práticas das abordagens utilizadas até o momento a duas novas metodologias. Primeira, construir contextos considerando etiquetas anteriores e seguintes. Segunda, complementando a primeira, construir contextos de tamanhos variáveis de acordo com sua relevância. Graças ao suporte ferramental principalmente livros ligados ao tema - e ao apoio financeiro propiciado pela bolsa, ambos oferecidos pela UNIPAMPA, foi possível alcançar o grau de maturidade em que a presente pesquisa hoje se encontra. Os planos incluídos na sequência dos trabalhos trazem uma forte expectativa de que seus frutos contribuam com o estado da arte da área.Downloads
Os dados de download ainda não estão disponíveis.
Publicado
2020-02-14
Edição
Seção
Artigos
Como Citar
Análise Morfossintática Utilizando HMM e Perceptron. Anais do Salão Inovação, Ensino, Pesquisa e Extensão, [S. l.], v. 5, n. 2, 2020. Disponível em: https://periodicos.unipampa.edu.br/index.php/SIEPE/article/view/65781. Acesso em: 22 set. 2026.