dissertação

How good lusophones are data science Llm agents?: evaluating agentic approaches for data science in portuguese contexts

Carregando...
Imagem de Miniatura

Notas

Editores

Título da Revista

ISSN da Revista

Título de Volume

Editor

Universidade Federal de Lavras

Faculdade, Instituto ou Escola

Instituto de Ciências Exatas e Tecnológicas (ICET)

Departamento

Programa de Pós-Graduação

Programa de Pós-Graduação em Ciência da Computação

Agência de fomento

Coordenação de Aperfeiçoamento de Pessoal de Nível Superior (CAPES)

Tipo de impacto

Tecnológico

Áreas Temáticas da Extensão

Tecnologia e produção

Objetivos de Desenvolvimento Sustentável

ODS 8: Trabalho decente e crescimento econômico
ODS 10: Redução das desigualdades
ODS 12: Consumo e produção responsáveis

Dados abertos

Resumo

A Ciência de Dados (CD), um campo complexo que envolve conhecimentos avançados de estatística, matemática e programação, tem sido historicamente restrita a profissionais humanos profundamente qualificados. Esse paradigma foi desafiado por avanços recentes no raciocínio artificial e pela expansão do conjunto de ferramentas dos grandes modelos de linguagem (LLMs). Mais especificamente, o desempenho da CD automatizada foi impulsionado para níveis próximos aos humanos por frameworks agentes, nos quais ferramentas como execução de código e busca de documentos são fornecidas aos LLMs. Entretanto, a pesquisa atual sobre métodos baseados em LLM para CD automatizada ainda é fortemente enviesada em favor da língua inglesa. Neste trabalho, é apresentada uma avaliação de CD utilizando agentes para prompts, dados e metadados em português em comparação ao inglês. Para esse fim, foi desenvolvido o DATAEXPLAINER, um framework de agente voltado à geração de soluções de CD com explicações passo-a-passo no idioma requerido pelo usuário. Com o framework desenvolvido, quatro modelos diferentes de LLM foram avaliados em um conjunto de sete competições coletadas do site Kaggle e traduzidas. Soluções coerentes em português foram produzidas por todos os LLMs avaliados (com mais de 97% do texto gerado no idioma correto), com o agente pareado ao modelo GPT-OSS superando o usuário médio do site Kaggle em cinco das sete competições avaliadas. Houve uma lacuna de desempenho entre as línguas, com pontuações médias 10,1% menores para o português em comparação ao inglês; contudo, a diferença não alcançou a significância estatística. Essa diferença em pontuação tendeu a ser maior para tarefas de regressão e para modelos ajustados para código e menor para modelos de raciocínio.

Abstract

Data Science (DS), a complex field often involving advanced concepts of statistics, mathematics, and programming, has historically been restricted to deeply knowledgeable human professionals. Recent advancements in artificial reasoning and the expanding toolset of Large Language Models (LLMs) have challenged this paradigm. More specifically, agentic frameworks, which provide LLMs tools like code execution and document searching, have pushed automated DS performance to near-human levels. However, current research on LLM-based methods for automated DS is still heavily biased towards the English language. In this work, we provide an assessment for agentic DS for prompting, data, and metadata in Portuguese in comparison to English. To this end, we expanded on previous advancements to develop DATAEXPLAINER, an agentic framework for generating DS solutions with step-by-step explanations in the target language. We employed the aforementioned framework to evaluate four different LLM models on a set of seven different translated Kaggle competitions. All assessed LLMs produced coherent Portuguese solutions (more than 97% of text generated in the correct language), with the agent powered by GPT-OSS surpassing the average Kaggle user on five out of the seven evaluated competitions. There is still a gap in performance, with 10.1% lower mean scores for Portuguese across models when compared to English; however, the difference did not reach statistical significance. Additionally, the data indicates a larger gap for regression tasks and code-tuned models, and a smaller gap for thinking models.

Descrição

Área de concentração

Ciência da Computação

Linha de pesquisa

Inteligência Artificial e Otimização

Agência de desenvolvimento

Palavra chave

Marca

Objetivo

Procedência

Impacto da pesquisa

Resumen

ISBN

DOI

Citação

Lima, João Paulo Paiva. How good lusophones are data science Llm agents?: evaluating agentic approaches for data science in portuguese contexts. 2026. 110 p. Dissertação (Mestrado em Ciência da Computação) - Universidade Federal de Lavras, Lavras, 2026.

Link externo

Avaliação

Revisão

Suplementado Por

Referenciado Por

Licença Creative Commons

Exceto quando indicado de outra forma, a licença deste item é descrita como Attribution 3.0 Brazil