Extração Inteligente de Dados da Wikipédia

Autores

  • Cristhian Bilhalva
  • Sérgio Luis Sardi Mergen

Palavras-chave:

Crawler, Dados, Grafo, Relacionamento

Resumo

Um dos meios de comunicação que mais cresceu nos últimos anos foi a Internet, permitindo assim que milhares de pessoas pudessem conectar-se, gerando milhões de páginas em blogs e sites, atualizando enciclopédias online e difundindo todo o tipo de conteúdo de diversos contextos. Para facilitar o acesso a esse grande volume de informação, foi concebido um projeto de pesquisa voltado à extração de dados na Web. Em um trabalho desenvolvido dentro desse projeto, foi criado um repositório de informações para guardar relacionamentos entre artigos escritos na Wikipédia com o objetivo de ajudar a encontrar artigos relacionados com um artigo em específico através de uma busca, para isso era necessário uma grande extração de dados. Existem várias situações em que é necessário descobrir páginas que têm maior relacionamento umas com as outras, como por exemplo, em anúncios de páginas na internet, se um cliente visita uma página de esportes é provável que ele tenha interesse em outras páginas do mesmo tipo. O presente trabalho visa à busca somente de artigos realmente relevantes, ou seja, artigos que tem algo em comum, para que o tempo gasto executando a extração na internet seja diminuído e a geração de grafos para a uma melhor visualização dos dados extraídos. Para atingir esses objetivos, foi desenvolvido um algoritmo de crawling focado. O algoritmo visita uma página semente, extrai todos os links de interesse colocando-os em uma fila de links a serem visitados. Em seguida, ele visita os links da fila, repetindo o processo de extração citado anteriormente. Para manter somente as páginas mais relevantes, o algoritmo irá adicionar na fila de links e inserir no grafo apenas as páginas que contenham informações consideradas realmente importantes. Além disso, é criada a relação entre a página da onde o link veio e a página que está sendo processada. A informação necessária para saber se página deverá ser processada ou não e adicionada no grafo está em uma lista de bloqueio. Essa lista armazena as palavras mais frequentes encontradas em todos os artigos que levaram até o artigo sendo processado. O valor mínimo de frequência é determinado por um parâmetro configurável. Para verificar a eficácia do algoritmo, ele foi executado utilizando como página semente o artigo referente à Unipampa na Wikipédia. Foi então utilizada uma ferramenta para visualização de grafos, que mostrou que os artigos relacionados à Unipampa envolvem assuntos como universidade, campus, reitoria, entre outros que se verificam realmente ter uma associação com a página da Unipampa. Sem a restrição imposta pelo algoritmo, a coleta acabaria recuperando milhares de artigos com pouca relevância, gastando tempo desnecessariamente. Como trabalhos futuros, pretende-se investigar outras formas de crawling focado, como por exemplo, alimentando a lista de bloqueio com base na incidência de palavras nos artigos visitados, em vez da sua frequência.

Downloads

Os dados de download ainda não estão disponíveis.

Publicado

2020-02-14

Como Citar

Extração Inteligente de Dados da Wikipédia. Anais do Salão Inovação, Ensino, Pesquisa e Extensão, [S. l.], v. 5, n. 2, 2020. Disponível em: https://periodicos.unipampa.edu.br/index.php/SIEPE/article/view/65783. Acesso em: 23 set. 2026.