Categorização automática de produtos utilizando apenas o título e aprendizado profundo

dc.contributor.advisor1Santos, Thiago Oliveira dos
dc.contributor.advisor1IDhttps://orcid.org/0000-0001-7607-635X
dc.contributor.authorPaulucio, Leonardo Santos
dc.contributor.referee1Ciarelli, Patrick Marques
dc.contributor.referee1IDhttps://orcid.org/0000000331774028
dc.contributor.referee1Latteshttp://lattes.cnpq.br/1267950518719423
dc.contributor.referee2Varejão, Flavio Miguel
dc.contributor.referee2Latteshttp://lattes.cnpq.br/6501574961643171
dc.date.accessioned2024-05-30T00:53:25Z
dc.date.available2024-05-30T00:53:25Z
dc.date.issued2022-02-14
dc.description.abstractNatural Language Processing (NLP) has been receiving increasing attention in the past few years. In part, this is related to the huge flow of data being made available everyday on the internet, which increased the need for automatic tools capable of analyzing and extracting relevant information, especially from the text. In this context, text classification became one of the most studied tasks on the NLP domain. The objective is to assign predefined categories or labels to text or sentences. Important applications include sentence classification, sentiment analysis, spam detection, among many others. This work proposes an automatic system for product categorization using only their titles. The proposed system employs a state-of-the-art deep neural network as a tool to extract features from the titles to be used as input in different machine learning models. The system is evaluated in the large-scale Mercado Libre dataset, which has the common characteristics of real-world problems such as imbalanced classes, unreliable labels, besides having a large number of samples: 20,000,000 in total. The results showed that the proposed system was able to correctly categorize the products with a balanced accuracy of 86.57% on the local test split of the Mercado Libre dataset. It also surpassed the fourth place on the public rank of the MeLi Data Challenge with 91.19% of balanced accuracy, which represents less than 1% of the difference to the winner.
dc.description.resumoO Processamento de Linguagem Natural (PLN) tem recebido uma atenção cada vez maior nos últimos anos. Em parte, isso está relacionado ao enorme fluxo de dados disponibilizados todos os dias na internet, o que aumentou a necessidade de ferramentas automáticas capazes de analisar e extrair informações relevantes, principalmente do texto. Nesse contexto, a classificação de textos tornou-se uma das tarefas mais estudadas no domínio do PLN. O objetivo é atribuir categorias ou rótulos predefinidos a textos ou frases. Aplicativos importantes incluem classificação de frases, análise de sentimento, detecção de spam, entre muitos outros. Este trabalho propõe um sistema automático de categorização de produtos utilizando apenas seus títulos. O sistema proposto emprega uma rede neural profunda de última geração como uma ferramenta para extrair recursos dos títulos a serem usados como entrada em diferentes modelos de aprendizado de máquina. O sistema é avaliado no conjunto de dados do Mercado Libre de larga escala, que possui características comuns a problemas do mundo real, como classes desequilibradas, rótulos não confiáveis, além de possuir um grande número de amostras: 20.000.000 no total. Os resultados mostraram que o sistema proposto foi capaz de categorizar corretamente os produtos com uma precisão balanceada de 86,57% na divisão de teste local do conjunto de dados do Mercado Libre. Também ultrapassou o quarto lugar no ranking público do MeLi Data Challenge com 91,19% de precisão balanceada, o que representa menos de 1% da diferença para o vencedor.
dc.formatText
dc.identifier.urihttps://dspace5.ufes.br/handle/10/15983
dc.languagepor
dc.publisherUniversidade Federal do Espírito Santo
dc.publisher.countryBR
dc.publisher.courseMestrado em Informática
dc.publisher.departmentCentro Tecnológico
dc.publisher.initialsUFES
dc.publisher.programPrograma de Pós-Graduação em Informática
dc.rightsopen access
dc.subjectClassificação de texto
dc.subjectAprendizado de máquina
dc.subjectInteligência artificial
dc.subject.br-rjbnsubject.br-rjbn
dc.subject.cnpqCiência da Computação
dc.titleCategorização automática de produtos utilizando apenas o título e aprendizado profundo
dc.typemasterThesis

Arquivos

Pacote original

Agora exibindo 1 - 1 de 1
Carregando...
Imagem de Miniatura
Nome:
LeonardoSantosPaulucio-2022-dissertacao.pdf
Tamanho:
2.34 MB
Formato:
Adobe Portable Document Format