Mostrando postagens com marcador mineração de textos. Mostrar todas as postagens
Mostrando postagens com marcador mineração de textos. Mostrar todas as postagens

quinta-feira, 6 de agosto de 2015

Doutorando do ICMC ganha prêmio internacional por novo método que classifica textos

Técnica desenvolvida por estudante foi premiada em uma das maiores conferências de linguística do mundo


Rafael Rossi e Solange Rezende receberam prêmio por artigo científico 


Imagine que você é dono de uma empresa e quer medir o grau de satisfação dos seus clientes nas redes sociais. Como filtrar rapidamente, entre milhares de publicações, os comentários positivos e negativos sobre sua marca? Uma técnica desenvolvida por um aluno de doutorado do Instituto de Ciências Matemáticas e de Computação (ICMC) da USP, em São Carlos, promete facilitar esse trabalho. 

O criador do modelo, Rafael Rossi, escreveu um artigo científico mostrando os resultados obtidos e foi um dos dois premiados na 16th International Conference on Intelligent Text Processing and Computational Linguistics, uma das principais conferências de linguística e mineração de textos do mundo, realizada em abril, no Egito. Foram 62 países participantes e 329 artigos enviados à conferência. Apenas 95 deles foram aceitos e destes, dois premiados. 

Para identificar quantas pessoas estão elogiando ou criticando um produto em uma rede social, por exemplo, basta o empresário selecionar alguns comentários bons e outros ruins sobre sua empresa. Com a técnica criada por Rossi, é possível identificar os termos utilizados pelos usuários nesses comentários e classificar, automaticamente, todos os demais depoimentos em positivos ou negativos. 

Para tornar essa classificação viável, o doutorando desenvolveu um algoritmo, uma sequência de comandos que é passada para o computador a fim de definir uma tarefa. Nesse caso, a tarefa é classificar textos baseando-se em uma rede de termos. Com esse algoritmo, é possível rotular e organizar uma grande quantidade de textos a partir de poucas unidades previamente classificadas. “Hoje em dia, com a grande quantidade de textos encontrados em diversos tipos de plataformas, é humanamente impossível organizar, processar e extrair conhecimento de todos eles”, conta o estudante, que é bolsista da Fundação de Amparo à Pesquisa do Estado de São Paulo (FAPESP).

Foco no que interessa – A grande quantidade de informações a que um leitor está exposto quando realiza uma simples pesquisa na internet muitas vezes atrapalha e desvia seu foco. O modelo proposto por Rossi contribui para agilizar e facilitar esse processo.

“O diferencial do trabalho é que ele não considera apenas a frequência dos termos nos documentos, que é o mais comum nesse tipo de pesquisa. Leva-se em conta também a relação entre termos para realizar a classificação dos textos”, explica a orientadora do projeto, Solange Rezende, do ICMC. A professora diz ainda que, dessa forma, o que não é de interesse do leitor é automaticamente descartado. No trabalho, Solange e Rossi contam ainda com o apoio do professor Alneu Lopes, também do ICMC.

Outra possível aplicação do método é na organização de uma biblioteca virtual. O algoritmo consegue identificar e organizar os gêneros de uma grande quantidade de livros através de termos retirados de alguns exemplares anteriormente classificados. Assim, a separação dos livros por temas é facilitada.

O doutorando, que recebeu o prêmio pelo artigo Term Network Approach for Transductive Classification, defenderá sua tese nos próximos meses no ICMC.

Texto: Henrique Fontes – Assessoria de Comunicação ICMC/USP

Mais informações
Assessoria de comunicação do ICMC: (16) 3373.9666
E-mail: comunica@icmc.usp.br

segunda-feira, 19 de agosto de 2013

Parceria entre ICMC e Embrapa cria tecnologias com mineração de textos

Conhecimento gerado poderá ser aplicado a projetos relacionados a zoneamento agrícola, auxílio ao gerenciamento de recursos naturais e organização da informação, entre outros


Pesquisas desenvolvidas em parceria entre o Instituto de Ciências Matemáticas e de Computação (ICMC) da USP São Carlos e a Embrapa Informática Agropecuária, de Campinas, estão empregando técnicas de mineração de textos (text mining) com o objetivo de organizar e analisar a informação técnico-científica disponível para apoio à gestão do conhecimento e da inovação. Os resultados obtidos por meio dessas pesquisas poderão ser aplicados a vários projetos relacionados a zoneamento agrícola, auxílio ao gerenciamento de recursos naturais e organização da informação, entre outros.

As técnicas de mineração de textos visam auxiliar especialistas na organização, análise e descoberta de conhecimento em grandes coleções de documentos, segundo a professora do ICMC Solange Rezende. “A pesquisa em mineração de textos contribui para o avanço de todas as áreas do conhecimento, pois torna possível o acesso rápido à informação mais relevante de acordo com as necessidades dos usuários, e o acesso ao conhecimento, em geral, escondido nesses dados”, afirmou Rezende.

Segundo Rezende, pesquisa em mineração de texto contribui
para avanços em todas as áreas do conhecimento
“Com os resultados da aplicação das técnicas de mineração de textos, os especialistas serão capazes de encontrar documentos relevantes para uma determinada região e/ou temática, obtendo uma visão geral do conhecimento produzido até o momento sobre aquele assunto, o que facilita a seleção de informações específicas e relevantes, como dados socioeconômicos ou o impacto ambiental das culturas relacionadas àquela região e/ou temática”, explicou Rezende.

De acordo com a pesquisadora Maria Fernanda Moura, da Embrapa Informática Agropecuária – que fez doutorado no ICMC –, a equipe vem trabalhando com ferramentas capazes de identificar e classificar, de forma automática, tópicos textuais, cobertura geográfica dos textos e tópicos, além da cobertura temporal. As tecnologias envolvem métodos e ferramentas de análise de dados, como classificadores e técnicas de extração de informações e de desambiguação de termos e a produção de softwares adaptados para a língua portuguesa.

A desambiguação textual permite que um sistema computacional reconheça, de forma automática, palavras extraídas de uma publicação em seu contexto de abrangência. Um exemplo é a identificação correta de determinada cidade ainda que existam outras com o mesmo nome. Com o método criado pelos pesquisadores, o sistema consegue reconhecer as localidades mais próximas e indicar aquela que está sendo referida em um texto.

Um exemplo da aplicação dessas técnicas de mineração de textos é o projeto Tecnologias Inovadoras em mineração de textos para apoio à Espacialização de Notícias Agrícolas - piloto cana-de-açúcar (Tiena). Para validar as tecnologias em desenvolvimento, foi construído um protótipo de software que permitiu consultar uma base de dados de notícias agrícolas e observá-las de acordo com a região de abrangência, com classificação hierárquica dos temas abordados.

“Os resultados obtidos até agora foram muito bons, com um grau de precisão bastante elevado se compararmos com outros métodos existentes”, disse Moura. As informações extraídas são inseridas em uma base de dados para consulta. A ideia é usar esse conhecimento para aprimorar a metodologia usada e aplicar em publicações científicas. “Se tivermos bases históricas, podemos construir cenários que servirão para orientar a criação de políticas públicas, por exemplo”, complementou.

Outro exemplo é o projeto Compilação e Recuperação de Informações Técnico-científicas e Indução ao Conhecimento de Forma Ágil na Rede AgroHidro (Critic@). Resultado de uma parceria entre o ICMC, a Embrapa Informática Agropecuária, a Embrapa Monitoramento por Satélite (Campinas) e o Instituto de Engenharia de Sistemas e Computadores do Porto (Portugal), o projeto visa analisar a produção científica de uma rede de pesquisa para identificar temas e tendências tecnológicas.

A equipe que atua no Critic@ pretende aprofundar as pesquisas com a aplicação de classificadores, ou seja, recursos computacionais que vão permitir classificar os textos em tópicos, de forma hierárquica, conforme a sua relevância no contexto estudado. “São estratégias de business intelligence”, contou Moura. “De posse dessas informações, é possível definir cenários e inclusive estabelecer parcerias mais focadas”, finalizou.


Texto e foto: Denise Casatti - Assessoria de Comunicação ICMC
Com informações da Assessoria de Comunicação da Embrapa (http://www.embrapa.br/embrapa/imprensa/noticias/2013/agosto/2a-semana/pesquisadores-criam-tecnologias-com-mineracao-de-textos#)