How good lusophones are data science Llm agents?: evaluating agentic approaches for data science in portuguese contexts

dc.contributor.advisorPereira, Denilson Alves
dc.contributor.co-advisorPereira, Marluce Rodrigues
dc.contributor.refereeMerschmann, Luiz Henrique de Campos
dc.contributor.refereePereira, Marluce Rodrigues
dc.contributor.refereeBrandão, Wladmir Cardoso
dc.creatorLima, João Paulo Paiva
dc.creator.Latteshttp://lattes.cnpq.br/3116914552841541
dc.creator.orcidhttps://orcid.org/0009-0003-7659-2233
dc.date.accessioned2026-07-17T13:41:22Z
dc.date.issued2026-05-22
dc.description.abstractData Science (DS), a complex field often involving advanced concepts of statistics, mathematics, and programming, has historically been restricted to deeply knowledgeable human professionals. Recent advancements in artificial reasoning and the expanding toolset of Large Language Models (LLMs) have challenged this paradigm. More specifically, agentic frameworks, which provide LLMs tools like code execution and document searching, have pushed automated DS performance to near-human levels. However, current research on LLM-based methods for automated DS is still heavily biased towards the English language. In this work, we provide an assessment for agentic DS for prompting, data, and metadata in Portuguese in comparison to English. To this end, we expanded on previous advancements to develop DATAEXPLAINER, an agentic framework for generating DS solutions with step-by-step explanations in the target language. We employed the aforementioned framework to evaluate four different LLM models on a set of seven different translated Kaggle competitions. All assessed LLMs produced coherent Portuguese solutions (more than 97% of text generated in the correct language), with the agent powered by GPT-OSS surpassing the average Kaggle user on five out of the seven evaluated competitions. There is still a gap in performance, with 10.1% lower mean scores for Portuguese across models when compared to English; however, the difference did not reach statistical significance. Additionally, the data indicates a larger gap for regression tasks and code-tuned models, and a smaller gap for thinking models.
dc.description.areastematicasdaextensaoTecnologia e produção
dc.description.concentrationCiência da Computação
dc.description.odsODS 8: Trabalho decente e crescimento econômico
dc.description.odsODS 10: Redução das desigualdades
dc.description.odsODS 12: Consumo e produção responsáveis
dc.description.researchLineInteligência Artificial e Otimização
dc.description.resumoA Ciência de Dados (CD), um campo complexo que envolve conhecimentos avançados de estatística, matemática e programação, tem sido historicamente restrita a profissionais humanos profundamente qualificados. Esse paradigma foi desafiado por avanços recentes no raciocínio artificial e pela expansão do conjunto de ferramentas dos grandes modelos de linguagem (LLMs). Mais especificamente, o desempenho da CD automatizada foi impulsionado para níveis próximos aos humanos por frameworks agentes, nos quais ferramentas como execução de código e busca de documentos são fornecidas aos LLMs. Entretanto, a pesquisa atual sobre métodos baseados em LLM para CD automatizada ainda é fortemente enviesada em favor da língua inglesa. Neste trabalho, é apresentada uma avaliação de CD utilizando agentes para prompts, dados e metadados em português em comparação ao inglês. Para esse fim, foi desenvolvido o DATAEXPLAINER, um framework de agente voltado à geração de soluções de CD com explicações passo-a-passo no idioma requerido pelo usuário. Com o framework desenvolvido, quatro modelos diferentes de LLM foram avaliados em um conjunto de sete competições coletadas do site Kaggle e traduzidas. Soluções coerentes em português foram produzidas por todos os LLMs avaliados (com mais de 97% do texto gerado no idioma correto), com o agente pareado ao modelo GPT-OSS superando o usuário médio do site Kaggle em cinco das sete competições avaliadas. Houve uma lacuna de desempenho entre as línguas, com pontuações médias 10,1% menores para o português em comparação ao inglês; contudo, a diferença não alcançou a significância estatística. Essa diferença em pontuação tendeu a ser maior para tarefas de regressão e para modelos ajustados para código e menor para modelos de raciocínio.
dc.description.sponsorshipCoordenação de Aperfeiçoamento de Pessoal de Nível Superior (CAPES)
dc.description.tipodeimpactoTecnológico
dc.identifier.citationLima, João Paulo Paiva. How good lusophones are data science Llm agents?: evaluating agentic approaches for data science in portuguese contexts. 2026. 110 p. Dissertação (Mestrado em Ciência da Computação) - Universidade Federal de Lavras, Lavras, 2026.
dc.identifier.urihttps://repositorio.ufla.br/handle/1/61021
dc.language.isoen_US
dc.publisherUniversidade Federal de Lavras
dc.publisher.collegeInstituto de Ciências Exatas e Tecnológicas (ICET)
dc.publisher.countrybrasil
dc.publisher.initialsUFLA
dc.publisher.programPrograma de Pós-Graduação em Ciência da Computação
dc.rightsAttribution 3.0 Brazilen
dc.rights.urihttp://creativecommons.org/licenses/by/3.0/br/
dc.subjectAprendizado de máquina
dc.subjectGrandes modelos de linguagem
dc.subjectCiência de dados
dc.subjectProcessamento de linguagem natural
dc.subjectLarge language models
dc.subjectData science
dc.subjectMachine learning
dc.subjectNatural language processing
dc.subject.cnpqCiência da Computação
dc.titleHow good lusophones are data science Llm agents?: evaluating agentic approaches for data science in portuguese contexts
dc.title.alternativeAgentes de Llms para ciência de dados são bons lusófonos?: avaliando técnicas baseadas em agentes para ciência de dados em contextos de língua portuguesa
dc.typedissertação

Arquivos

Pacote original

Agora exibindo 1 - 2 de 2
Carregando...
Imagem de Miniatura
Nome:
Texto completo
Tamanho:
780.34 KB
Formato:
Adobe Portable Document Format
Carregando...
Imagem de Miniatura
Nome:
Impactos da pesquisa
Tamanho:
187.62 KB
Formato:
Adobe Portable Document Format

Licença do pacote

Agora exibindo 1 - 1 de 1
Carregando...
Imagem de Miniatura
Nome:
license.txt
Tamanho:
955 B
Formato:
Item-specific license agreed upon to submission
Descrição: