Label noise detection under Noise at Random model with ensemble filters

MOURA, Kecia Gomes de

dc.contributor	PRUDÊNCIO, Ricardo Bastos Cavalcante
dc.contributor	CAVALCANTI, George Darmiton da Cunha
dc.contributor	http://lattes.cnpq.br/9290980721484997
dc.contributor	http://lattes.cnpq.br/2984888073123287
dc.contributor	http://lattes.cnpq.br/8577312109146354
dc.creator	MOURA, Kecia Gomes de
dc.date	2020-01-17T12:05:08Z
dc.date	2020-01-17T12:05:08Z
dc.date	2019-03-15
dc.date.accessioned	2022-10-06T17:38:52Z
dc.date.available	2022-10-06T17:38:52Z
dc.identifier	MOURA, Kecia Gomes de. Label noise detection under Noise at Random model with ensemble filters. 2019. Dissertação (Mestrado em Ciência da computação) – Universidade Federal de Pernambuco, Recife, 2019.
dc.identifier	https://repositorio.ufpe.br/handle/123456789/36043
dc.identifier.uri	http://repositorioslatinoamericanos.uchile.cl/handle/2250/3987512
dc.description	Label noise detection has been widely studied in Machine Learning due to its importance to improve training data quality. Satisfactory noise detection has been achieved by adopting an ensemble of classifiers. In this approach, an instance is assigned as mislabeled if a high proportion of members in the pool misclassifies that instance. Previous authors have empirically evaluated this approach with results in accuracy, nevertheless, they mostly assumed that label noise is generated completely at random in a dataset. This is a strong assumption since there are other types of label noise which are feasible in practice and can influence noise detection results. This work investigates the performance of ensemble noise detection in two different noise models: the Noisy at Random (NAR), in which the probability of label noise depends on the instance class, in comparison to the Noisy Completely at Random model, in which the probability of label noise is completely independent. In this setting, we also investigate the effect of class distribution on noise detection performance, since it changes the total noise level observed in a dataset under the NAR assumption. Further, an evaluation of the ensemble vote threshold is carried out to contrast with the most common approaches in the literature. Finally, it is shown in a number of performed experiments that the choice of a noise generation model over another can lead to distinct results when taking into consideration aspects such as class imbalance and noise level ratio among different classes.
dc.description	CNPq
dc.description	A detecção de ruído de dados tem sido amplamente estudada em Aprendizagem de Máquina devido à sua importância para melhorar a qualidade dos dados de treinamento. Uma detecção de ruído satisfatória tem sido conseguida através da utilização de um conjunto de classificadores (ensemble). Nessa abordagem, uma instância é considerada como rotulada erroneamente se uma alta proporção de classificadores a classificarem incorretamente. Trabalhos anteriores avaliaram empiricamente esta abordagem obtendo resultados na acurácia. No entanto, a maioria deles, assumem que o ruído de rótulo é gerado completamente ao acaso em um conjunto de dados. Essa suposição singular pode induzir em erro ou a resultados incompletos uma vez que existem outros tipos de ruídos de rótulo que são viáveis na prática e podem influenciar os resultados de detecção. Este trabalho investiga o desempenho da detecção de ruído levando em consideração o modelo "Noisy at Random" (NAR), no qual a probabilidade de ruído de rótulo depende da classe da instância, em comparação ao modelo "Noisy Completely at Random" (NCAR), em que o ruído de rótulo é totalmente aleatório. Nesse cenário, também investigamos o efeito do desbalanceamento de classes no desempenho da detecção de ruído, uma vez que essa desproporção altera o nível total de ruído observado quando há a suposição de NAR. Além disso, uma avaliação do limiar para a votação do ensemble é realizada para contrastar com as abordagens mais comuns na literatura. Finalmente, é demonstrado em vários experimentos realizados que a escolha por um modelo de geração de ruído em detrimento de outro pode levar a resultados distintos considerando-se aspectos como desbalanceamento de classes e proporção de ruído em cada classe.
dc.format	application/pdf
dc.language	por
dc.publisher	Universidade Federal de Pernambuco
dc.publisher	UFPE
dc.publisher	Brasil
dc.publisher	Programa de Pos Graduacao em Ciencia da Computacao
dc.rights	openAccess
dc.rights	Attribution-NonCommercial-NoDerivs 3.0 Brazil
dc.rights	http://creativecommons.org/licenses/by-nc-nd/3.0/br/
dc.subject	Machine Learning
dc.subject	Detecção de Ruído
dc.subject	Combinação de Classificadores
dc.subject	Ruído Aleatório
dc.title	Label noise detection under Noise at Random model with ensemble filters
dc.type	masterThesis

Este ítem pertenece a la siguiente institución

Universidade Federal de Pernambuco (Brasil)