Uma medida de similaridade textual para identificação de plágio em fóruns educacionais

Exportar este item:

Use este identificador para citar ou linkar para este item: http://www.tede2.ufrpe.br:8080/tede2/handle/tede2/7868

Registro completo de metadados

Campo DC	Valor	Idioma
dc.creator	CAVALCANTI, Anderson Pinheiro	-
dc.creator.Lattes	http://lattes.cnpq.br/3833454062140432	por
dc.contributor.advisor1	MELLO, Rafael Ferreira Leite de	-
dc.contributor.advisor-co1	MIRANDA, Péricles Barbosa Cunha de	-
dc.contributor.referee1	MIRANDA, Péricles Barbosa Cunha de	-
dc.contributor.referee2	LIMA, Rinaldo José de	-
dc.contributor.referee3	FREITAS, Frederico Luiz Gonçalves de	-
dc.date.accessioned	2019-02-26T14:31:01Z	-
dc.date.issued	2018-01-31	-
dc.identifier.citation	CAVALCANTI, Anderson Pinheiro. Uma medida de similaridade textual para identificação de plágio em fóruns educacionais. 2018. 88 f. Dissertação (Programa de Pós-Graduação em Informática Aplicada) - Universidade Federal Rural de Pernambuco, Recife.	por
dc.identifier.uri	http://www.tede2.ufrpe.br:8080/tede2/handle/tede2/7868	-
dc.description.resumo	Com o crescente uso da tecnologia como ferramenta de apoio educacional, o uso de Ambiente Virtual de Aprendizagem (AVA) tem aumentado nos últimos anos. Estes ambientes disponibilizam várias ferramentas para melhorar a interação entre professores e alunos, tais como fórum, blog, wiki, entre outras. Estas ferramentas possuem um grande potencial para gerar conteúdo, o que pode ser usado para auxiliar no processo de ensino-aprendizagem. Porém, devido a grande quantidade de interações entre os alunos e o professor, torna-se difícil para o professor avaliar e acompanhar todo o material que é disponibilizado pelos alunos. Uma ferramenta que se destaca em relação à geração de conteúdo colaborativo é o fórum. Dentre as possíveis funcionalidades dos fóruns se destaca a questão da avaliação. Muitas disciplinas a distância utilizam a interação no fórum como forma de avaliação dos alunos. Contudo, devido a grande quantidade de dados postado na ferramenta, é difícil para o professor identificar problemas nas postagens, como por exemplo a detecção de plágio. A base fundamental para a criação de sistemas automáticos de detecção de plágio é a criação de uma medida de similaridade que possa medir a relação existente entre dois textos. A similaridade entre textos é importante em diversas aplicações de Processamento de Linguagem Natural (PLN), como recuperação de informação, sumarização de texto, extração de informações e agrupamento de texto. Várias medidas de similaridade entre textos já foram criadas; entretanto, em geral, elas são dependentes de idioma. No caso do português, poucas medidas foram encontradas e a maioria utiliza apenas técnicas estatísticas, não levando em consideração aspectos semânticos dos textos. Além disso, existem trabalhos na literatura para identificação de plágio em atividades, artigos científicos ou trabalhos de conclusão de curso. No entanto, quando o contexto é fóruns educacionais a identificação de plágio se torna ainda mais difícil por causa principalmente do tamanho do texto e por não exigir uma linguagem formal. Diante disso, este trabalho propõe uma medida que calcula a similaridade existente entre sentenças escritas em português levando em consideração a semântica dos textos. Esta medida foi avaliada na base da competição Workshop de Avaliação de Similaridade Semântica e Inferência Textual (ASSIN) 2016. A medida proposta alcançou resultados melhores que o primeiro colocado da competição atingindo 0,70 de correlação de Pearson e 0,47 de erro quadrático médio. Além desta avaliação, foi realizado um estudo de caso para avaliação de similaridade em postagens de fóruns educacionais em uma disciplina de Ciência da Computação. Os resultados foram avaliados pelos professores da disciplina que confirmaram a eficácia da ferramenta.	por
dc.description.abstract	With the increasing use of technology as an educational support tool, the use of Virtual Learning Environment (VLE) has increased in recent years. These environments provide several tools to improve the interaction between teachers and students, where some examples are: forum, blog, wiki, among others. These tools have great potential for generating content, which can be used to aid in the process of teaching learning. However, due to the great amount of interactions between the students and the teacher, it is difficult for the teacher to evaluate and follow up all the material that is made available by the students. A tool that stands out in relation to the generation of collaborative content is the forum. Among the possible functionalities of the forums is the question of evaluation. Many distance disciplines use forum interaction as a form of student assessment. However, with the large amount of information posted on the tool, it often becomes impractical for the teacher to manually detect plagiarism in the responses. The fundamental basis for the creation of automatic plagiarism detection systems is the creation of a measure of similarity that can measure the relationship between two texts. The similarity between texts is important in several Natural Language Processing (NLP) applications, such as retrieving information, summarizing text, extracting information, and grouping text. For example, in retrieval of information, the similarity measure is used to assign a classification score between a query and the obtained text. Various measures of similarity between texts can be found; however, in general, they are language dependent. In the case of Portuguese, few measures have been found and most use only statistical techniques, not taking into account semantic aspects of texts. In addition, there are papers in the literature to identify plagiarism in activities, scientific articles or course completion work. However, when context is educational forums the identification of plagiarism becomes even more difficult mainly because of the size of the text and by not requiring a formal language. Therefore, this paper aims to propose a measure that calculates the similarity between sentences written in Portuguese taking into account the semantics of texts. This measure was evaluated on the basis of the ASSIN workshop 2016. The proposed measure achieved better results than the first place in the competition reaching 0.70 Pearson correlation and 0.47 mean squared error. In addition to this evaluation, a case study was carried out to evaluate similarity in postings of educational forums in a discipline of Computer Science. The results were evaluated by the teachers of the discipline who confirmed the effectiveness of the tool.	eng
dc.description.provenance	Submitted by Mario BC (mario@bc.ufrpe.br) on 2019-02-26T14:31:01Z No. of bitstreams: 1 Anderson Pinheiro Cavalcanti.pdf: 3360691 bytes, checksum: d2510e8043cac677443d65100e0f9663 (MD5)	eng
dc.description.provenance	Made available in DSpace on 2019-02-26T14:31:01Z (GMT). No. of bitstreams: 1 Anderson Pinheiro Cavalcanti.pdf: 3360691 bytes, checksum: d2510e8043cac677443d65100e0f9663 (MD5) Previous issue date: 2018-01-31	eng
dc.format	application/pdf	*
dc.language	por	por
dc.publisher	Universidade Federal Rural de Pernambuco	por
dc.publisher.department	Departamento de Estatística e Informática	por
dc.publisher.country	Brasil	por
dc.publisher.initials	UFRPE	por
dc.publisher.program	Programa de Pós-Graduação em Informática Aplicada	por
dc.rights	Acesso Aberto	por
dc.subject	Educação a distância	por
dc.subject	Fórum educacional	por
dc.subject	Similaridade semântica	por
dc.subject	Plágio	por
dc.subject	Mineração de texto	por
dc.subject.cnpq	CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO	por
dc.title	Uma medida de similaridade textual para identificação de plágio em fóruns educacionais	por
dc.type	Dissertação	por
Aparece nas coleções:	Mestrado em Informática Aplicada

Arquivos associados a este item:

Arquivo	Descrição	Tamanho	Formato
Anderson Pinheiro Cavalcanti.pdf	Documento principal	3,28 MB	Adobe PDF	Baixar/Abrir Pré-Visualizar ×

Mostrar registro simples do item Recomendar este item Visualizar estatísticas

Biblioteca Digital de Teses e Dissertações

Biblioteca Digital de Teses e Dissertações