Categorização automática de produtos utilizando apenas o título e aprendizado profundo
| dc.contributor.advisor1 | Santos, Thiago Oliveira dos | |
| dc.contributor.advisor1ID | https://orcid.org/0000-0001-7607-635X | |
| dc.contributor.author | Paulucio, Leonardo Santos | |
| dc.contributor.referee1 | Ciarelli, Patrick Marques | |
| dc.contributor.referee1ID | https://orcid.org/0000000331774028 | |
| dc.contributor.referee1Lattes | http://lattes.cnpq.br/1267950518719423 | |
| dc.contributor.referee2 | Varejão, Flavio Miguel | |
| dc.contributor.referee2Lattes | http://lattes.cnpq.br/6501574961643171 | |
| dc.date.accessioned | 2024-05-30T00:53:25Z | |
| dc.date.available | 2024-05-30T00:53:25Z | |
| dc.date.issued | 2022-02-14 | |
| dc.description.abstract | Natural Language Processing (NLP) has been receiving increasing attention in the past few years. In part, this is related to the huge flow of data being made available everyday on the internet, which increased the need for automatic tools capable of analyzing and extracting relevant information, especially from the text. In this context, text classification became one of the most studied tasks on the NLP domain. The objective is to assign predefined categories or labels to text or sentences. Important applications include sentence classification, sentiment analysis, spam detection, among many others. This work proposes an automatic system for product categorization using only their titles. The proposed system employs a state-of-the-art deep neural network as a tool to extract features from the titles to be used as input in different machine learning models. The system is evaluated in the large-scale Mercado Libre dataset, which has the common characteristics of real-world problems such as imbalanced classes, unreliable labels, besides having a large number of samples: 20,000,000 in total. The results showed that the proposed system was able to correctly categorize the products with a balanced accuracy of 86.57% on the local test split of the Mercado Libre dataset. It also surpassed the fourth place on the public rank of the MeLi Data Challenge with 91.19% of balanced accuracy, which represents less than 1% of the difference to the winner. | |
| dc.description.resumo | O Processamento de Linguagem Natural (PLN) tem recebido uma atenção cada vez maior nos últimos anos. Em parte, isso está relacionado ao enorme fluxo de dados disponibilizados todos os dias na internet, o que aumentou a necessidade de ferramentas automáticas capazes de analisar e extrair informações relevantes, principalmente do texto. Nesse contexto, a classificação de textos tornou-se uma das tarefas mais estudadas no domínio do PLN. O objetivo é atribuir categorias ou rótulos predefinidos a textos ou frases. Aplicativos importantes incluem classificação de frases, análise de sentimento, detecção de spam, entre muitos outros. Este trabalho propõe um sistema automático de categorização de produtos utilizando apenas seus títulos. O sistema proposto emprega uma rede neural profunda de última geração como uma ferramenta para extrair recursos dos títulos a serem usados como entrada em diferentes modelos de aprendizado de máquina. O sistema é avaliado no conjunto de dados do Mercado Libre de larga escala, que possui características comuns a problemas do mundo real, como classes desequilibradas, rótulos não confiáveis, além de possuir um grande número de amostras: 20.000.000 no total. Os resultados mostraram que o sistema proposto foi capaz de categorizar corretamente os produtos com uma precisão balanceada de 86,57% na divisão de teste local do conjunto de dados do Mercado Libre. Também ultrapassou o quarto lugar no ranking público do MeLi Data Challenge com 91,19% de precisão balanceada, o que representa menos de 1% da diferença para o vencedor. | |
| dc.format | Text | |
| dc.identifier.uri | https://dspace5.ufes.br/handle/10/15983 | |
| dc.language | por | |
| dc.publisher | Universidade Federal do Espírito Santo | |
| dc.publisher.country | BR | |
| dc.publisher.course | Mestrado em Informática | |
| dc.publisher.department | Centro Tecnológico | |
| dc.publisher.initials | UFES | |
| dc.publisher.program | Programa de Pós-Graduação em Informática | |
| dc.rights | open access | |
| dc.subject | Classificação de texto | |
| dc.subject | Aprendizado de máquina | |
| dc.subject | Inteligência artificial | |
| dc.subject.br-rjbn | subject.br-rjbn | |
| dc.subject.cnpq | Ciência da Computação | |
| dc.title | Categorização automática de produtos utilizando apenas o título e aprendizado profundo | |
| dc.type | masterThesis |
Arquivos
Pacote original
1 - 1 de 1
Carregando...
- Nome:
- LeonardoSantosPaulucio-2022-dissertacao.pdf
- Tamanho:
- 2.34 MB
- Formato:
- Adobe Portable Document Format
