How good lusophones are data science Llm agents?: evaluating agentic approaches for data science in portuguese contexts
| dc.contributor.advisor | Pereira, Denilson Alves | |
| dc.contributor.co-advisor | Pereira, Marluce Rodrigues | |
| dc.contributor.referee | Merschmann, Luiz Henrique de Campos | |
| dc.contributor.referee | Pereira, Marluce Rodrigues | |
| dc.contributor.referee | Brandão, Wladmir Cardoso | |
| dc.creator | Lima, João Paulo Paiva | |
| dc.creator.Lattes | http://lattes.cnpq.br/3116914552841541 | |
| dc.creator.orcid | https://orcid.org/0009-0003-7659-2233 | |
| dc.date.accessioned | 2026-07-17T13:41:22Z | |
| dc.date.issued | 2026-05-22 | |
| dc.description.abstract | Data Science (DS), a complex field often involving advanced concepts of statistics, mathematics, and programming, has historically been restricted to deeply knowledgeable human professionals. Recent advancements in artificial reasoning and the expanding toolset of Large Language Models (LLMs) have challenged this paradigm. More specifically, agentic frameworks, which provide LLMs tools like code execution and document searching, have pushed automated DS performance to near-human levels. However, current research on LLM-based methods for automated DS is still heavily biased towards the English language. In this work, we provide an assessment for agentic DS for prompting, data, and metadata in Portuguese in comparison to English. To this end, we expanded on previous advancements to develop DATAEXPLAINER, an agentic framework for generating DS solutions with step-by-step explanations in the target language. We employed the aforementioned framework to evaluate four different LLM models on a set of seven different translated Kaggle competitions. All assessed LLMs produced coherent Portuguese solutions (more than 97% of text generated in the correct language), with the agent powered by GPT-OSS surpassing the average Kaggle user on five out of the seven evaluated competitions. There is still a gap in performance, with 10.1% lower mean scores for Portuguese across models when compared to English; however, the difference did not reach statistical significance. Additionally, the data indicates a larger gap for regression tasks and code-tuned models, and a smaller gap for thinking models. | |
| dc.description.areastematicasdaextensao | Tecnologia e produção | |
| dc.description.concentration | Ciência da Computação | |
| dc.description.ods | ODS 8: Trabalho decente e crescimento econômico | |
| dc.description.ods | ODS 10: Redução das desigualdades | |
| dc.description.ods | ODS 12: Consumo e produção responsáveis | |
| dc.description.researchLine | Inteligência Artificial e Otimização | |
| dc.description.resumo | A Ciência de Dados (CD), um campo complexo que envolve conhecimentos avançados de estatística, matemática e programação, tem sido historicamente restrita a profissionais humanos profundamente qualificados. Esse paradigma foi desafiado por avanços recentes no raciocínio artificial e pela expansão do conjunto de ferramentas dos grandes modelos de linguagem (LLMs). Mais especificamente, o desempenho da CD automatizada foi impulsionado para níveis próximos aos humanos por frameworks agentes, nos quais ferramentas como execução de código e busca de documentos são fornecidas aos LLMs. Entretanto, a pesquisa atual sobre métodos baseados em LLM para CD automatizada ainda é fortemente enviesada em favor da língua inglesa. Neste trabalho, é apresentada uma avaliação de CD utilizando agentes para prompts, dados e metadados em português em comparação ao inglês. Para esse fim, foi desenvolvido o DATAEXPLAINER, um framework de agente voltado à geração de soluções de CD com explicações passo-a-passo no idioma requerido pelo usuário. Com o framework desenvolvido, quatro modelos diferentes de LLM foram avaliados em um conjunto de sete competições coletadas do site Kaggle e traduzidas. Soluções coerentes em português foram produzidas por todos os LLMs avaliados (com mais de 97% do texto gerado no idioma correto), com o agente pareado ao modelo GPT-OSS superando o usuário médio do site Kaggle em cinco das sete competições avaliadas. Houve uma lacuna de desempenho entre as línguas, com pontuações médias 10,1% menores para o português em comparação ao inglês; contudo, a diferença não alcançou a significância estatística. Essa diferença em pontuação tendeu a ser maior para tarefas de regressão e para modelos ajustados para código e menor para modelos de raciocínio. | |
| dc.description.sponsorship | Coordenação de Aperfeiçoamento de Pessoal de Nível Superior (CAPES) | |
| dc.description.tipodeimpacto | Tecnológico | |
| dc.identifier.citation | Lima, João Paulo Paiva. How good lusophones are data science Llm agents?: evaluating agentic approaches for data science in portuguese contexts. 2026. 110 p. Dissertação (Mestrado em Ciência da Computação) - Universidade Federal de Lavras, Lavras, 2026. | |
| dc.identifier.uri | https://repositorio.ufla.br/handle/1/61021 | |
| dc.language.iso | en_US | |
| dc.publisher | Universidade Federal de Lavras | |
| dc.publisher.college | Instituto de Ciências Exatas e Tecnológicas (ICET) | |
| dc.publisher.country | brasil | |
| dc.publisher.initials | UFLA | |
| dc.publisher.program | Programa de Pós-Graduação em Ciência da Computação | |
| dc.rights | Attribution 3.0 Brazil | en |
| dc.rights.uri | http://creativecommons.org/licenses/by/3.0/br/ | |
| dc.subject | Aprendizado de máquina | |
| dc.subject | Grandes modelos de linguagem | |
| dc.subject | Ciência de dados | |
| dc.subject | Processamento de linguagem natural | |
| dc.subject | Large language models | |
| dc.subject | Data science | |
| dc.subject | Machine learning | |
| dc.subject | Natural language processing | |
| dc.subject.cnpq | Ciência da Computação | |
| dc.title | How good lusophones are data science Llm agents?: evaluating agentic approaches for data science in portuguese contexts | |
| dc.title.alternative | Agentes de Llms para ciência de dados são bons lusófonos?: avaliando técnicas baseadas em agentes para ciência de dados em contextos de língua portuguesa | |
| dc.type | dissertação |
Arquivos
Licença do pacote
1 - 1 de 1
Carregando...
- Nome:
- license.txt
- Tamanho:
- 955 B
- Formato:
- Item-specific license agreed upon to submission
- Descrição:
