Análise de Dependência Não Supervisionada Aplicada ao Português
Palavras-chave:
Análise, sintática, Aprendizado, máquina, PortuguêsResumo
Cada vez mais os computadores vêm sendo empregados na tentativa de criar uma inteligência similar à do ser humano. A criação e utilização de analisadores sintáticos surge como solução para o problema do processamento de linguagem natural. Que através do aprendizado de máquina induz a gramática de uma determinada linguagem. Este trabalho teve como objetivo, a comparação de resultados para análise sintática de dependência entre o português e o inglês. Então para fins de análise de resultados utilizamos o modelo DMV (Dependency Model with Valence) proposto por Klein e Manning em 2004, para testes e aprendizados são utilizados córpus de notação sintática, que para o inglês foi utilizado o WSJ, córpus do Wall Street Jornal mas utilizamos uma versão reduzida de somente sentenças até tamanho 10. Já para o português utilizou-se o córpus Tycho Brahe, desenvolvido pela UNICAMP, com um limitante de também sentenças até tamanho 10. Como medida de comparação somente foi utilizada a medida-F não rotulada, que informa o desempenho de um analisador sintático sobre as etiquetas de uma sentença. Sobre as etapas de treinamento são feitas 40 iterações sobre o algoritmo ME, maximização de expectativas. Este trabalho foi baseado na implementação de Luque desenvolvido em 2011, sua versão é totalmente feita na linguagem de programação Python e utilizada a biblioteca de processamento de linguagem natural do Python (NLTK). Os resultados de medida-F para o córpus de notação sintática WSJ foi de 65.3%, sobre um conjunto de 7422 sentenças, já para o córpus Tycho Brahe obteve-se uma medida-F de 50.7%, sobre um conjunto de 3938 sentenças. Percebe-se que por possuir poucas árvores de notação sintática para o português a medida-F deste foi muito baixa em comparativo com o inglês. Outra possibilidade é que o português apresenta grande ambiguidade em suas sentenças, o que dificulta a tarefa de análise sintática. Uma solução possível para este problema seria combinar modelos de aprendizado de máquina supervisionado observando as etiquetas destes córpus de treinamento, como o algoritmo de CKY proposto por Eisner em 1996 que induz regras gramaticais de uma linguagem, através de etiquetas de de um conjunto de árvores de notação sintática.Downloads
Os dados de download ainda não estão disponíveis.
Publicado
2020-02-14
Edição
Seção
Artigos
Como Citar
Análise de Dependência Não Supervisionada Aplicada ao Português. Anais do Salão Inovação, Ensino, Pesquisa e Extensão, [S. l.], v. 5, n. 2, 2020. Disponível em: https://periodicos.unipampa.edu.br/index.php/SIEPE/article/view/65789. Acesso em: 22 set. 2026.