Abordagens baseadas na análise de séries temporais não lineares para a detecção de mudanças de conceito no contexto do aprendizado adaptativo supervisionado

CHIKUSHI, Rohgi Toshio Meneses

Use este identificador para citar ou linkar para este item: https://repositorio.ufpe.br/handle/123456789/45629

Compartilhe esta página

Registro completo de metadados

Campo DC	Valor	Idioma
dc.contributor.advisor	BARROS, Roberto Souto Maior de	-
dc.contributor.author	CHIKUSHI, Rohgi Toshio Meneses	-
dc.date.accessioned	2022-08-11T14:26:45Z	-
dc.date.available	2022-08-11T14:26:45Z	-
dc.date.issued	2021-08-25	-
dc.identifier.citation	CHIKUSHI, Rohgi Toshio Meneses. Abordagens baseadas na análise de séries temporais não lineares para a detecção de mudanças de conceito no contexto do aprendizado adaptativo supervisionado. 2021. Tese (Doutorado em Ciência da Computação) - Universidade Federal de Pernambuco, Recife, 2021.	pt_BR
dc.identifier.uri	https://repositorio.ufpe.br/handle/123456789/45629	-
dc.description.abstract	Atualmente, algoritmos de Aprendizado de Máquina são aplicados em diversos domínios para a extração de informação em grandes volumes de dados. Apesar de modelos consolidados lidarem de forma efetiva com dados identicamente e independentemente distribuídos (i.i.d.), algoritmos aplicados a fluxos contínuos de dados devem lidar com distribuições não estacioná- rias. O desafio é manter um modelo de decisão atualizado, preciso e consistente, mesmo sujeito a mudanças nas distribuições de probabilidade dos dados, um fenômeno conhecido como mu- dança de conceito. Neste contexto, os algoritmos combinam um classificador e um detector para identificar mudanças na distribuição do erro das predições a fim de adaptar ou substi- tuir rapidamente o modelo preditivo. Diversas propostas têm sido apresentadas na literatura para a detecção de mudanças de conceito com base na taxa de erro dos modelos preditivos. Em geral, a distribuição da taxa de erro fundamenta a maioria das abordagens baseadas em metodologias como a análise sequencial, o controle estatístico do processo, ou pelo monito- ramento das distribuições por meio de janelas deslizantes, as quais assumem que os erros de predição são gerados de forma independente. Apesar da vasta aplicação desses detectores, estudos empíricos têm mostrado que a taxa de erro pode ser influenciada pela dependência temporal. Além disso, abordagens supervisionadas requerem dados rotulados, os quais podem ser difíceis de obter em muitas aplicações do mundo real. Nesta tese, ferramentas de Análise de Séries Temporais Não Lineares foram utilizadas com o objetivo de prover detectores não restritos ao pressuposto de observações i.i.d e mais apropriados para lidar com fluxos de da- dos sujeitos à dependência temporal. Neste sentido, foram propostos três detectores: Spectral Entropy Drift Detector (SEDD), Permutation Entropy Drift Detector (PEDD), e Recurrence Quantification Analysis Drift Detector (RQADD). Também foi proposto o Symbolic Labeling Adapter (SLA), uma abordagem de pseudo-rotulação simbólica com o intuito de expandir a aplicação de modelos adaptativos supervisionados a domínios onde fluxos de dados não são rotulados, visando a detecção de mudanças de conceito. Experimentos com os classificadores Naïve Bayes e Hoffding Tree utilizando 15 detectores, 20 bases de dados reais e 360 artificiais, sugerem que o SEDD, embora não tenha superado o estado da arte em termos de acurácia na maioria dos cenários, não apresentou diferença estatística significativa em relação aos mes- mos, sinalizando menos alarmes falsos. De modo semelhante, os detectores PEDD e RQADD foram competitivos acerca das detecções de mudanças de conceito na maioria das avaliações, principalmente utilizando o SLA com bases não rotuladas (30 artificiais e 26 de eletroence- falograma). Desse modo, pode-se considerar os detectores propostos como uma alternativa competitiva, e a abordagem de pseudo-rotulação simbólica uma ferramenta promissora.	pt_BR
dc.language.iso	por	pt_BR
dc.publisher	Universidade Federal de Pernambuco	pt_BR
dc.rights	openAccess	pt_BR
dc.rights.uri	http://creativecommons.org/licenses/by-nc-nd/3.0/br/	*
dc.subject	Inteligência computacional	pt_BR
dc.subject	Aprendizado de máquina	pt_BR
dc.subject	Fluxos de dados	pt_BR
dc.subject	Séries temporais não lineares	pt_BR
dc.title	Abordagens baseadas na análise de séries temporais não lineares para a detecção de mudanças de conceito no contexto do aprendizado adaptativo supervisionado	pt_BR
dc.type	doctoralThesis	pt_BR
dc.contributor.advisor-co	SILVA, Marilú Gomes Netto Monte da	-
dc.contributor.authorLattes	http://lattes.cnpq.br/5393685698143691	pt_BR
dc.publisher.initials	UFPE	pt_BR
dc.publisher.country	Brasil	pt_BR
dc.degree.level	doutorado	pt_BR
dc.contributor.advisorLattes	http://lattes.cnpq.br/2153962690732683	pt_BR
dc.publisher.program	Programa de Pos Graduacao em Ciencia da Computacao	pt_BR
dc.description.abstractx	Currently, Machine Learning algorithms are applied in several domains to extract in- formation from large datasets. Although most models effectively deal with identically and independently distributed (i.i.d.) data, algorithms applied to data streams must deal with non- stationary distributions. The challenge is to maintain an up-to-date, accurate and consistent decision model, even when changes in the probability distributions of the data occur, a phe- nomenon known as concept drift. In this context, algorithms usually combine a classifier and a detector to identify changes in the error distribution of the predictions in order to quickly adapt or replace the predictive model. Several proposals have been presented in the litera- ture for detecting concept drift based on the error rate of predictive models. In general, the error rate distribution underlies most approaches based on methodologies such as sequential analysis, statistical process control, or by monitoring distributions through sliding windows, which assume that prediction errors are generated independently. Despite the wide applica- tion of these detectors, empirical studies have shown that the error rate can be influenced by temporal dependence. In addition, supervised approaches require labeled data, which can be difficult to obtain in many real-world applications. In this thesis, Nonlinear Time Series Analysis tools were used in order to propose detectors not restricted to the assumption of i.i.d. observations, and more appropriate to deal with data streams subjected to temporal depen- dence. In this sense, three detectors are proposed: Spectral Entropy Drift Detector (SEDD), Permutation Entropy Drift Detector (PEDD), and Recurrence Quantification Analysis Drift Detector (RQADD). It was also proposed the Symbolic Labeling Adapter (SLA), a symbolic pseudo-labeling approach in order to expand the application of supervised adaptive models to domains where data flows are not labelled, aiming to detect concept changes. Experiments with the classifiers Naïve Bayes and Hoffding Tree using 15 detectors, 20 real datasets and 360 artificial ones, suggest that SEDD, although it has not outperformed those state-of-art detectors in accuracy in most scenarios, did not show statistical difference in relation to them, signaling fewer false alarms. Similarly, the PEDD and RQADD detectors were competitive on the detections of concept drift in most evaluations, mainly using SLA with unlabeled datasets (30 artificial and 26 electroencephalogram). Therefore, the proposed detectors can be con- sidered as a competitive alternative, and the symbolic pseudo-labeling approach a promising tool.	pt_BR
dc.contributor.advisor-coLattes	http://lattes.cnpq.br/8098480041936192	pt_BR
Aparece nas coleções:	Teses de Doutorado - Ciência da Computação

Arquivos associados a este item:

Arquivo	Descrição	Tamanho	Formato
TESE Rohgi Toshio Meneses Chikushi.pdf		4,48 MB	Adobe PDF	Visualizar/Abrir

Este arquivo é protegido por direitos autorais

Ver licença

Mostrar registro simples do item Recomendar este item Visualizar estatísticas

Este item está licenciada sob uma Licença Creative Commons