Dedupeer: um algoritmo para deduplicação de arquivos através de processamento particionado

Soares, Paulo Fernando Almeida

dc.contributor	Meira, Silvio Romero de Lemos
dc.contributor	Garcia, Vinicius Cardoso
dc.creator	Soares, Paulo Fernando Almeida
dc.date	2015-03-13T12:53:37Z
dc.date	2015-03-13T12:53:37Z
dc.date	2013-08-28
dc.identifier	SOARES, Paulo Fernando Almeida. Dedupeer: um algoritmo para deduplicação de arquivos através de processamento particionado. Recife, 2013. 100 f. Dissertação (mestrado) - UFPE, Centro de Informática, Programa de Pós-graduação em Ciência da Computação, 2013.
dc.identifier	https://repositorio.ufpe.br/handle/123456789/12355
dc.description	A deduplicação é uma técnica de compressão de dados sem perda que elimina dados redundantes tanto intra-file como inter-file, diferente de ferramentas de compressão de dados como o gzip que só eliminam a redundância intra-file. A deduplicação reduz a necessidade de armazenamento através da eliminação de blocos de dados redundantes. Na deduplicação, todos os blocos de dados que estão duplicados em um sistema de armazenamento podem ser reduzidos à uma única cópia, esses blocos desalocados pela deduplicação são transformados em referência para o que foi mantido no sistema. Técnicas de deduplicação começaram a ser estudadas para sistemas de armazenamento comerciais em meados de 2004. Hoje, os principais sistemas de armazenamento de dados usam deduplicação, mas os algoritmos implementados e as técnicas utilizadas não são detalhadas publicamente. Existem alguns trabalhos acadêmicos focados na implementação de algoritmos de deduplicação, mas eles são raros e não são voltados para a sua utilização em sistemas de armazenamento existentes. O principal objetivo deste trabalho é criar um algoritmo para deduplicação de arquivos no cliente de forma remota, através de processamento particionado e utilizando comparação por fingerprints. Este algoritmo foi incorporado em um componente de software com interface interoperável para facilitar a utilização em qualquer sistema de armazenamento de dados e beneficiá-los com economia de armazenamento, e na transferência de dados no caso dos sistemas de armazenamento distribuídos. Além do componente de software, foi desenvolvido também um sistema de armazenamento com gerenciamento de dados baseado no Apache Cassandra, o que o torna capaz de ser distribuído, com o objetivo de validar o algoritmo de deduplicação. A integração do componente de software com o sistema de armazenamento foi implementada e avaliada neste trabalho.
dc.format	application/pdf
dc.language	por
dc.publisher	Universidade Federal de Pernambuco
dc.rights	Attribution-NonCommercial-NoDerivs 3.0 Brazil
dc.rights	http://creativecommons.org/licenses/by-nc-nd/3.0/br/
dc.subject	Deduplicação
dc.subject	Compressão de dados
dc.subject	Economia de armazenamento
dc.subject	Sistemas de armazenamento de dados
dc.title	Dedupeer: um algoritmo para deduplicação de arquivos através de processamento particionado
dc.type	masterThesis

Este ítem pertenece a la siguiente institución

Universidade Federal de Pernambuco (Brasil)