Avaliação de modelos de linguagem para criação de chatbots para a comunicação com pessoas surdas que usam o português como segunda língua

dc.contributor.advisorPereira, Denilson Alves
dc.contributor.co-advisorFreire, André Pimenta
dc.contributor.refereePardo, Thiago Alexandre Salgueiro
dc.contributor.refereeMerschmann, Luiz Henrique de Campos
dc.creatorGonçalves, Anna Paula Figueiredo
dc.creator.Latteshttp://lattes.cnpq.br/1802308673231408
dc.creator.orcidhttps://orcid.org/0009-0007-6922-2452
dc.date.accessioned2025-11-25T19:35:43Z
dc.date.issued2025-09-24
dc.description.abstractLarge language models (LLMs) have established themselves as powerful tools for natural language processing, but their performance still presents challenges when applied to underrepresented linguistic variants. GLOSA—a textual representation that reflects the syntactic structure of LIBRAS—offers a controlled means of studying how models handle linguistic constructions similar to the written communication of deaf people, who frequently use Portuguese as a second language. This work investigated the adaptability of LLMs to GLOSA, with the aim of supporting the development of chatbots more accessible to the deaf community. Comparative experiments were conducted involving multiple open architectures of different sizes, evaluated in multilingual scenarios (English, Portuguese, GLOSA, and mixed data). Two fine-tuning strategies were applied to pre-trained models using databases constructed to reflect real GLOSA syntactic structures. The results confirm performance losses when migrating from English to Portuguese and, especially, to GLOSA, a pattern already observed in multilingual studies. However, targeted fine-tuning increased model interpretability, especially on larger architectures with robust multilingual pre-training, such as Phi-4-14B and Qwen2.5-14B. However, it was observed that excessive or misaligned adjustments can cause overfitting or decreased accuracy, highlighting the need for rigorous control in the adaptation process. This study offers three main contributions: (i) a novel dataset in GLOSA and Portuguese; (ii) a reproducible experimental pipeline for evaluating LLMs in unconventional linguistic scenarios; and (iii) practical recommendations for model tuning in accessibility-focused applications.
dc.description.areastematicasdaextensaoTecnologia e produção
dc.description.odsODS 4: Educação de qualidade
dc.description.odsODS 10: Redução das desigualdades
dc.description.resumoModelos de linguagem de grande porte (LLMs) têm se consolidado como ferramentas poderosas para processamento de linguagem natural, mas seu desempenho ainda apresenta desafios quando aplicados a variantes linguísticas pouco representadas. A GLOSA — representação textual que reflete a estrutura sintática da LIBRAS — oferece um meio controlado para estudar como modelos lidam com construções linguísticas próximas da comunicação escrita de pessoas surdas, que frequentemente utilizam o Português como segunda língua. Este trabalho investigou a capacidade de adaptação de LLMs à GLOSA, com o objetivo de subsidiar o desenvolvimento de chatbots mais acessíveis à comunidade surda. Foram conduzidos experimentos comparativos envolvendo múltiplas arquiteturas abertas, de diferentes portes, avaliadas em cenários multilíngues (Inglês, Português, GLOSA e dados mistos). Duas estratégias de fine-tuning foram aplicadas a modelos pré- treinados, utilizando bases de dados construídos para refletir estruturas sintáticas reais da GLOSA. Os resultados confirmam perdas de desempenho ao migrar do Inglês para o Português e, principalmente, para a GLOSA, padrão já observado em estudos multilíngues. Contudo, o fine-tuning direcionado aumentou a interpretabilidade dos modelos, especialmente em arquiteturas maiores e com pré-treinamento multilíngue robusto, como Phi-4-14B e Qwen2.5-14B. Observou-se, porém, que ajustes excessivos ou desalinhados podem causar sobreajuste ou queda de acurácia, evidenciando a necessidade de controle rigoroso no processo de adaptação. Este estudo oferece três contribuições principais: (i) um conjunto inédito de dados em GLOSA e Português; (ii) um pipeline experimental reprodutível para avaliação de LLMs em cenários linguísticos não convencionais; e (iii) recomendações práticas para o ajuste de modelos em aplicações voltadas à acessibilidade. LLMs; GLOSA; LIBRAS; chatbots; acessibilidade.
dc.description.sponsorshipCoordenação de Aperfeiçoamento de Pessoal de Nível Superior (CAPES)
dc.description.sponsorshipFundação de Amparo à Pesquisa do Estado de Minas Gerais (FAPEMIG)
dc.description.tipodeimpactoSociais
dc.description.tipodeimpactoTecnológico
dc.description.tipodeimpactoCulturais
dc.identifier.citationGONÇALVES, Anna Paula Figueiredo. Aliação de modelos de linguagem para criação de chatbots para a comunicação com pessoas surdas que usam o português como segunda língua. 2025. 140 p. Dissertação (Mestrado em Ciência da Computação) - Universidade Federal de Lavras, Lavras, 2025.
dc.identifier.urihttps://repositorio.ufla.br/handle/1/60475
dc.language.isopt_BR
dc.publisherUniversidade Federal de Lavras
dc.publisher.collegeInstituto de Ciências Exatas e Tecnológicas (ICET)
dc.publisher.countrybrasil
dc.publisher.departmentDepartamento de Ciência da Computação
dc.publisher.initialsUFLA
dc.publisher.programPrograma de Pós-Graduação em Ciência da Computação
dc.rightsAttribution 3.0 Brazilen
dc.rights.urihttp://creativecommons.org/licenses/by/3.0/br/
dc.subjectAcessibilidade
dc.subjectLíngua Brasileira de Sinais (Libras)
dc.subjectSurdos
dc.subjectInteligência artificial
dc.subjectProcessamento de linguagem natural
dc.subjectAccessibility
dc.subjectBrazilian Sign Language
dc.subjectDeaf
dc.subjectArtificial intelligence
dc.subjectNatural language processing
dc.subjectchatbots
dc.subject.cnpqCiência da Computação
dc.titleAvaliação de modelos de linguagem para criação de chatbots para a comunicação com pessoas surdas que usam o português como segunda língua
dc.title.alternativeEvaluation of language models for creating chatbots for communication with deaf people who use portuguese as a second language
dc.typedissertação

Arquivos

Pacote original

Agora exibindo 1 - 2 de 2
Carregando...
Imagem de Miniatura
Nome:
Texto completo
Tamanho:
2.59 MB
Formato:
Adobe Portable Document Format
Carregando...
Imagem de Miniatura
Nome:
Impactos da pesquisa
Tamanho:
141.06 KB
Formato:
Adobe Portable Document Format

Licença do pacote

Agora exibindo 1 - 1 de 1
Carregando...
Imagem de Miniatura
Nome:
license.txt
Tamanho:
955 B
Formato:
Item-specific license agreed upon to submission
Descrição: