dissertação

A methodology for synthetic data generation and validation applied to agricultural engineering

Carregando...
Imagem de Miniatura

Notas

Editores

Título da Revista

ISSN da Revista

Título de Volume

Editor

Universidade Federal de Lavras

Faculdade, Instituto ou Escola

Escola de Engenharia (EENG)

Departamento

Programa de Pós-Graduação

Programa de Pós-Graduação em Engenharia Agrícola

Agência de fomento

Coordenação de Aperfeiçoamento de Pessoal de Nível Superior (CAPES)

Tipo de impacto

Sociais
Tecnológico
Econômicos

Áreas Temáticas da Extenção

Meio ambiente
Saúde
Tecnologia e produção

Objetivos de Desenvolvimento Sustentável

ODS 2: Fome zero e agricultura sustentável
ODS 3: Saúde e bem-estar
ODS 7: Energia limpa e acessível
ODS 9: Indústria, inovação e infraestrutura
ODS 12: Consumo e produção responsáveis
ODS 13: Ação contra a mudança global do clima
ODS 15: Vida terrestre

Dados abertos

Resumo

A escassez de dados experimentais de qualidade, juntamente com os altos custos de análises laboratoriais e sensoriais, são barreiras significativas para o desenvolvimento da modelagem computacional e da inteligência artificial na área das Ciências Agrárias. Esta tese introduz um framework de engenharia reversa para a geração de dados sintéticos baseado na decomposição de Cholesky, que pode reconstruir distribuições multivariadas enquanto preserva as propriedades estatísticas e a dependência estrutural entre as variáveis. Como caso de estudo, a técnica foi empregada em um modelo para a qualidade sensorial do café Arábica com um conjunto de dados público do Coffee Quality Institute (𝑛 = 207 amostras). O método foi dividido em quatro estágios: (i) extração e pré-processamento de dados (ii) síntese estatística preservando momentos de ordem um e dois (iii) validação múltipla de fidelidade estatística e (iv) avaliação do poder preditivo via o protocolo Train Synthetic, Test Real (TSTR). Os resultados mostraram uma elevada fidelidade estrutural, obtendo-se similaridade da matriz de correlação 96,20% e similaridade pelo teste de Kolmogorov-Smirnov (KS) 85.81%, todas as variáveis ultrapassaram o limiar técnico de aceitação de 70%. Na regressão RF, apenas os modelos treinados com dados sintéticos alcançaram 𝑅2 = 0, 9498, Erro Médio Absoluto (MAE) de apenas 0,216 e precisão de 100% dentro da margem de erro de ±10%. Para a classificação ordinal da qualidade sensorial, a abordagem atingiu 89,37% de acurácia e (Weighted Quadratic) Kappa Coeficiente de 0,9558, mostrando concordância quase perfeita com os padrões da Specialty Coffee Asscociation (SCA). Como principal contribuição científica, esta tese estabelece um framework de engenharia reversa para reconstrução de bases de dados sintéticas a partir de estatísticas agregadas, demonstrando que a preservação simultânea da fidelidade estatística e da utilidade preditiva pode ser alcançada sem o emprego de modelos generativos profundos. A abordagem proposta amplia as possibilidades de compartilhamento seguro de dados, reduz a dependência de experimentação onerosa e oferece uma solução computacionalmente eficiente e de fácil reprodução, com elevado potencial de transferência tecnológica para aplicações em Engenharia Agrícola, Agronomia e demais áreas que dependem de bases de dados experimentais confiáveis.

Abstract

The scarcity of high-quality experimental data, coupled with the high costs of laboratory and sensory analyses, are significant barriers to the development of computational modeling and artificial intelligence in the field of Agricultural Sciences. This thesis introduces a reverse engineering framework for generating synthetic data based on Cholesky decomposition, which can reconstruct multivariate distributions while preserving statistical properties and structural dependence between variables. As a case study, the technique was employed in a model for the sensory quality of Arabica coffee using a public dataset from the Coffee Quality Institute (𝑛 = 207 samples). The method was divided into four stages: (i) data extraction and preprocessing (ii) statistical synthesis preserving first and second order moments (iii) multiple validation of statistical fidelity and (iv) evaluation of predictive power via the Train Synthetic, Test Real (TSTR) protocol. The results showed high structural fidelity, obtaining a correlation matrix similarity of 96.20% and a Kolmogorov-Smirnov (KS) test similarity of 85.81%; all variables exceeded the technical acceptance threshold of 70%. In RF regression, only the models trained with synthetic data achieved R² = 0.9498, a Mean Absolute Error (MAE) of only 0.216, and 100% accuracy within a margin of error of ±10%. For the ordinal classification of sensory quality, the approach achieved 89.37% accuracy and a Weighted Quadratic Kappa Coefficient of 0.9558, showing almost perfect agreement with the standards of the Specialty Coffee Association (SCA). As its main scientific contribution, this thesis establishes a reverse engineering framework for reconstructing synthetic databases from aggregated statistics, demonstrating that the simultaneous preservation of statistical fidelity and predictive utility can be achieved without the use of deep generative models. The proposed approach expands the possibilities for secure data sharing, reduces dependence on costly experimentation, and offers a computationally efficient and easily reproducible solution with high potential for technology transfer to applications in Agricultural Engineering, Agronomy, and other areas that depend on reliable experimental databases.

Descrição

Área de concentração

Máquinas e Mecanização Agrícola

Linha de pesquisa

Engenharia Agrícola

Agência de desenvolvimento

Palavra chave

Marca

Objetivo

Procedência

Impacto da pesquisa

Resumen

ISBN

DOI

Citação

BRANDÃO JÚNIOR, Luiz Carlos. A methodology for synthetic data generation and validation applied to agricultural engineering. 2026. 172 p. Tese (Doutorado em Engenharia Agrícola) - Universidade Federal de Lavras, Lavras, 2026.

Link externo

Avaliação

Revisão

Suplementado Por

Referenciado Por

Licença Creative Commons

Exceto quando indicado de outra forma, a licença deste item é descrita como Attribution 3.0 Brazil