dc.contributorPRUDÊNCIO, Ricardo Bastos Cavalcante
dc.contributorCAVALCANTI, George Darmiton da Cunha
dc.contributorhttp://lattes.cnpq.br/9290980721484997
dc.contributorhttp://lattes.cnpq.br/2984888073123287
dc.contributorhttp://lattes.cnpq.br/8577312109146354
dc.creatorMOURA, Kecia Gomes de
dc.date2020-01-17T12:05:08Z
dc.date2020-01-17T12:05:08Z
dc.date2019-03-15
dc.date.accessioned2022-10-06T17:38:52Z
dc.date.available2022-10-06T17:38:52Z
dc.identifierMOURA, Kecia Gomes de. Label noise detection under Noise at Random model with ensemble filters. 2019. Dissertação (Mestrado em Ciência da computação) – Universidade Federal de Pernambuco, Recife, 2019.
dc.identifierhttps://repositorio.ufpe.br/handle/123456789/36043
dc.identifier.urihttp://repositorioslatinoamericanos.uchile.cl/handle/2250/3987512
dc.descriptionLabel noise detection has been widely studied in Machine Learning due to its importance to improve training data quality. Satisfactory noise detection has been achieved by adopting an ensemble of classifiers. In this approach, an instance is assigned as mislabeled if a high proportion of members in the pool misclassifies that instance. Previous authors have empirically evaluated this approach with results in accuracy, nevertheless, they mostly assumed that label noise is generated completely at random in a dataset. This is a strong assumption since there are other types of label noise which are feasible in practice and can influence noise detection results. This work investigates the performance of ensemble noise detection in two different noise models: the Noisy at Random (NAR), in which the probability of label noise depends on the instance class, in comparison to the Noisy Completely at Random model, in which the probability of label noise is completely independent. In this setting, we also investigate the effect of class distribution on noise detection performance, since it changes the total noise level observed in a dataset under the NAR assumption. Further, an evaluation of the ensemble vote threshold is carried out to contrast with the most common approaches in the literature. Finally, it is shown in a number of performed experiments that the choice of a noise generation model over another can lead to distinct results when taking into consideration aspects such as class imbalance and noise level ratio among different classes.
dc.descriptionCNPq
dc.descriptionA detecção de ruído de dados tem sido amplamente estudada em Aprendizagem de Máquina devido à sua importância para melhorar a qualidade dos dados de treinamento. Uma detecção de ruído satisfatória tem sido conseguida através da utilização de um conjunto de classificadores (ensemble). Nessa abordagem, uma instância é considerada como rotulada erroneamente se uma alta proporção de classificadores a classificarem incorretamente. Trabalhos anteriores avaliaram empiricamente esta abordagem obtendo resultados na acurácia. No entanto, a maioria deles, assumem que o ruído de rótulo é gerado completamente ao acaso em um conjunto de dados. Essa suposição singular pode induzir em erro ou a resultados incompletos uma vez que existem outros tipos de ruídos de rótulo que são viáveis na prática e podem influenciar os resultados de detecção. Este trabalho investiga o desempenho da detecção de ruído levando em consideração o modelo "Noisy at Random" (NAR), no qual a probabilidade de ruído de rótulo depende da classe da instância, em comparação ao modelo "Noisy Completely at Random" (NCAR), em que o ruído de rótulo é totalmente aleatório. Nesse cenário, também investigamos o efeito do desbalanceamento de classes no desempenho da detecção de ruído, uma vez que essa desproporção altera o nível total de ruído observado quando há a suposição de NAR. Além disso, uma avaliação do limiar para a votação do ensemble é realizada para contrastar com as abordagens mais comuns na literatura. Finalmente, é demonstrado em vários experimentos realizados que a escolha por um modelo de geração de ruído em detrimento de outro pode levar a resultados distintos considerando-se aspectos como desbalanceamento de classes e proporção de ruído em cada classe.
dc.formatapplication/pdf
dc.languagepor
dc.publisherUniversidade Federal de Pernambuco
dc.publisherUFPE
dc.publisherBrasil
dc.publisherPrograma de Pos Graduacao em Ciencia da Computacao
dc.rightsopenAccess
dc.rightsAttribution-NonCommercial-NoDerivs 3.0 Brazil
dc.rightshttp://creativecommons.org/licenses/by-nc-nd/3.0/br/
dc.subjectMachine Learning
dc.subjectDetecção de Ruído
dc.subjectCombinação de Classificadores
dc.subjectRuído Aleatório
dc.titleLabel noise detection under Noise at Random model with ensemble filters
dc.typemasterThesis


Este ítem pertenece a la siguiente institución