dissertação
A methodology for synthetic data generation and validation applied to agricultural engineering
Carregando...
Notas
Data
Autores
Orientadores
Editores
Coorientadores
Título da Revista
ISSN da Revista
Título de Volume
Editor
Universidade Federal de Lavras
Faculdade, Instituto ou Escola
Escola de Engenharia (EENG)
Departamento
Programa de Pós-Graduação
Programa de Pós-Graduação em Engenharia Agrícola
Agência de fomento
Coordenação de Aperfeiçoamento de Pessoal de Nível Superior (CAPES)
Tipo de impacto
Sociais
Tecnológico
Econômicos
Tecnológico
Econômicos
Áreas Temáticas da Extenção
Meio ambiente
Saúde
Tecnologia e produção
Saúde
Tecnologia e produção
Objetivos de Desenvolvimento Sustentável
ODS 2: Fome zero e agricultura sustentável
ODS 3: Saúde e bem-estar
ODS 7: Energia limpa e acessível
ODS 9: Indústria, inovação e infraestrutura
ODS 12: Consumo e produção responsáveis
ODS 13: Ação contra a mudança global do clima
ODS 15: Vida terrestre
ODS 3: Saúde e bem-estar
ODS 7: Energia limpa e acessível
ODS 9: Indústria, inovação e infraestrutura
ODS 12: Consumo e produção responsáveis
ODS 13: Ação contra a mudança global do clima
ODS 15: Vida terrestre
Dados abertos
Resumo
A escassez de dados experimentais de qualidade, juntamente com os altos custos de análises laboratoriais e sensoriais, são barreiras significativas para o desenvolvimento da modelagem computacional e da inteligência artificial na área das Ciências Agrárias. Esta tese introduz um framework de engenharia reversa para a geração de dados sintéticos baseado na decomposição de Cholesky, que pode reconstruir distribuições multivariadas enquanto preserva as propriedades estatísticas e a dependência estrutural entre as variáveis. Como caso de estudo, a técnica foi empregada em um modelo para a qualidade sensorial do café Arábica com um conjunto de dados público do Coffee Quality Institute (𝑛 = 207 amostras). O método foi dividido em quatro estágios: (i) extração e pré-processamento de dados (ii) síntese estatística preservando momentos de ordem um e dois (iii) validação múltipla de fidelidade estatística e (iv) avaliação do poder preditivo via o protocolo Train Synthetic, Test Real (TSTR). Os resultados mostraram uma elevada fidelidade estrutural, obtendo-se similaridade da matriz de correlação 96,20% e similaridade pelo teste de Kolmogorov-Smirnov (KS) 85.81%, todas as variáveis ultrapassaram o limiar técnico de aceitação de 70%. Na regressão RF, apenas os modelos treinados com dados sintéticos alcançaram 𝑅2 = 0, 9498, Erro Médio Absoluto (MAE) de apenas 0,216 e precisão de 100% dentro da margem de erro de ±10%. Para a classificação ordinal da qualidade sensorial, a abordagem atingiu 89,37% de acurácia e (Weighted Quadratic) Kappa Coeficiente de 0,9558, mostrando concordância quase perfeita com os padrões da Specialty Coffee Asscociation (SCA). Como principal contribuição científica, esta tese estabelece um framework de engenharia reversa para reconstrução de bases de dados sintéticas a partir de estatísticas agregadas, demonstrando que a preservação simultânea da fidelidade estatística e da utilidade preditiva pode ser alcançada sem o emprego de modelos generativos profundos. A abordagem proposta amplia as possibilidades de compartilhamento seguro de dados, reduz a dependência de experimentação onerosa e oferece uma solução computacionalmente eficiente e de fácil reprodução, com elevado potencial de transferência tecnológica para aplicações em Engenharia Agrícola, Agronomia e demais áreas que dependem de bases de dados experimentais confiáveis.
Abstract
The scarcity of high-quality experimental data, coupled with the high costs of laboratory and sensory analyses, are significant barriers to the development of computational modeling and artificial intelligence in the field of Agricultural Sciences. This thesis introduces a reverse engineering framework for generating synthetic data based on Cholesky decomposition, which can reconstruct multivariate distributions while preserving statistical properties and structural dependence between variables. As a case study, the technique was employed in a model for the sensory quality of Arabica coffee using a public dataset from the Coffee Quality Institute (𝑛 = 207 samples). The method was divided into four stages: (i) data extraction and preprocessing (ii) statistical synthesis preserving first and second order moments (iii) multiple validation of statistical fidelity and (iv) evaluation of predictive power via the Train Synthetic, Test Real (TSTR) protocol. The results showed high structural fidelity, obtaining a correlation matrix similarity of 96.20% and a Kolmogorov-Smirnov (KS) test similarity of 85.81%; all variables exceeded the technical acceptance threshold of 70%. In RF regression, only the models trained with synthetic data achieved R² = 0.9498, a Mean Absolute Error (MAE) of only 0.216, and 100% accuracy within a margin of error of ±10%. For the ordinal classification of sensory quality, the approach achieved 89.37% accuracy and a Weighted Quadratic Kappa Coefficient of 0.9558, showing almost perfect agreement with the standards of the Specialty Coffee Association (SCA). As its main scientific contribution, this thesis establishes a reverse engineering framework for reconstructing synthetic databases from aggregated statistics, demonstrating that the simultaneous preservation of statistical fidelity and predictive utility can be achieved without the use of deep generative models. The proposed approach expands the possibilities for secure data sharing, reduces dependence on costly experimentation, and offers a computationally efficient and easily reproducible solution with high potential for technology transfer to applications in Agricultural Engineering, Agronomy, and other areas that depend on reliable experimental databases.
Descrição
Área de concentração
Máquinas e Mecanização Agrícola
Linha de pesquisa
Engenharia Agrícola
Agência de desenvolvimento
Palavra chave
Marca
Objetivo
Procedência
Impacto da pesquisa
Resumen
ISBN
DOI
Citação
BRANDÃO JÚNIOR, Luiz Carlos. A methodology for synthetic data generation and validation applied to agricultural engineering. 2026. 172 p. Tese (Doutorado em Engenharia Agrícola) - Universidade Federal de Lavras, Lavras, 2026.
Link externo
Avaliação
Revisão
Suplementado Por
Referenciado Por
Licença Creative Commons
Exceto quando indicado de outra forma, a licença deste item é descrita como Attribution 3.0 Brazil

