A methodology for synthetic data generation and validation applied to agricultural engineering

dc.contributor.advisorMagalhães, Ricardo Rodrigues
dc.contributor.co-advisorFerreira, Danton Diego
dc.contributor.refereeFerreira, Danton Diego
dc.contributor.refereeLima, Danilo Alves de
dc.contributor.refereeLacerda, Wilian Soares
dc.contributor.refereeVitor, Giovanni Bernardes
dc.creatorBrandão Junior, Luiz Carlos
dc.creator.Latteshttp://lattes.cnpq.br/4992193748825216
dc.creator.orcidhttps://orcid.org/0009-0004-8513-0863
dc.date.accessioned2026-08-14T20:37:42Z
dc.date.issued2026-07-09
dc.description.abstractThe scarcity of high-quality experimental data, coupled with the high costs of laboratory and sensory analyses, are significant barriers to the development of computational modeling and artificial intelligence in the field of Agricultural Sciences. This thesis introduces a reverse engineering framework for generating synthetic data based on Cholesky decomposition, which can reconstruct multivariate distributions while preserving statistical properties and structural dependence between variables. As a case study, the technique was employed in a model for the sensory quality of Arabica coffee using a public dataset from the Coffee Quality Institute (𝑛 = 207 samples). The method was divided into four stages: (i) data extraction and preprocessing (ii) statistical synthesis preserving first and second order moments (iii) multiple validation of statistical fidelity and (iv) evaluation of predictive power via the Train Synthetic, Test Real (TSTR) protocol. The results showed high structural fidelity, obtaining a correlation matrix similarity of 96.20% and a Kolmogorov-Smirnov (KS) test similarity of 85.81%; all variables exceeded the technical acceptance threshold of 70%. In RF regression, only the models trained with synthetic data achieved R² = 0.9498, a Mean Absolute Error (MAE) of only 0.216, and 100% accuracy within a margin of error of ±10%. For the ordinal classification of sensory quality, the approach achieved 89.37% accuracy and a Weighted Quadratic Kappa Coefficient of 0.9558, showing almost perfect agreement with the standards of the Specialty Coffee Association (SCA). As its main scientific contribution, this thesis establishes a reverse engineering framework for reconstructing synthetic databases from aggregated statistics, demonstrating that the simultaneous preservation of statistical fidelity and predictive utility can be achieved without the use of deep generative models. The proposed approach expands the possibilities for secure data sharing, reduces dependence on costly experimentation, and offers a computationally efficient and easily reproducible solution with high potential for technology transfer to applications in Agricultural Engineering, Agronomy, and other areas that depend on reliable experimental databases.
dc.description.acaoclimatica2. Uso sustentável da água e do solo
dc.description.acaoclimatica6. Eficiência energética ou inovação ambiental
dc.description.areastematicasdaextensaoMeio ambiente
dc.description.areastematicasdaextensaoSaúde
dc.description.areastematicasdaextensaoTecnologia e produção
dc.description.concentrationMáquinas e Mecanização Agrícola
dc.description.odsODS 2: Fome zero e agricultura sustentável
dc.description.odsODS 3: Saúde e bem-estar
dc.description.odsODS 7: Energia limpa e acessível
dc.description.odsODS 9: Indústria, inovação e infraestrutura
dc.description.odsODS 12: Consumo e produção responsáveis
dc.description.odsODS 13: Ação contra a mudança global do clima
dc.description.odsODS 15: Vida terrestre
dc.description.researchLineEngenharia Agrícola
dc.description.resumoA escassez de dados experimentais de qualidade, juntamente com os altos custos de análises laboratoriais e sensoriais, são barreiras significativas para o desenvolvimento da modelagem computacional e da inteligência artificial na área das Ciências Agrárias. Esta tese introduz um framework de engenharia reversa para a geração de dados sintéticos baseado na decomposição de Cholesky, que pode reconstruir distribuições multivariadas enquanto preserva as propriedades estatísticas e a dependência estrutural entre as variáveis. Como caso de estudo, a técnica foi empregada em um modelo para a qualidade sensorial do café Arábica com um conjunto de dados público do Coffee Quality Institute (𝑛 = 207 amostras). O método foi dividido em quatro estágios: (i) extração e pré-processamento de dados (ii) síntese estatística preservando momentos de ordem um e dois (iii) validação múltipla de fidelidade estatística e (iv) avaliação do poder preditivo via o protocolo Train Synthetic, Test Real (TSTR). Os resultados mostraram uma elevada fidelidade estrutural, obtendo-se similaridade da matriz de correlação 96,20% e similaridade pelo teste de Kolmogorov-Smirnov (KS) 85.81%, todas as variáveis ultrapassaram o limiar técnico de aceitação de 70%. Na regressão RF, apenas os modelos treinados com dados sintéticos alcançaram 𝑅2 = 0, 9498, Erro Médio Absoluto (MAE) de apenas 0,216 e precisão de 100% dentro da margem de erro de ±10%. Para a classificação ordinal da qualidade sensorial, a abordagem atingiu 89,37% de acurácia e (Weighted Quadratic) Kappa Coeficiente de 0,9558, mostrando concordância quase perfeita com os padrões da Specialty Coffee Asscociation (SCA). Como principal contribuição científica, esta tese estabelece um framework de engenharia reversa para reconstrução de bases de dados sintéticas a partir de estatísticas agregadas, demonstrando que a preservação simultânea da fidelidade estatística e da utilidade preditiva pode ser alcançada sem o emprego de modelos generativos profundos. A abordagem proposta amplia as possibilidades de compartilhamento seguro de dados, reduz a dependência de experimentação onerosa e oferece uma solução computacionalmente eficiente e de fácil reprodução, com elevado potencial de transferência tecnológica para aplicações em Engenharia Agrícola, Agronomia e demais áreas que dependem de bases de dados experimentais confiáveis.
dc.description.sponsorshipCoordenação de Aperfeiçoamento de Pessoal de Nível Superior (CAPES)
dc.description.tipodeimpactoSociais
dc.description.tipodeimpactoTecnológico
dc.description.tipodeimpactoEconômicos
dc.identifier.citationBRANDÃO JÚNIOR, Luiz Carlos. A methodology for synthetic data generation and validation applied to agricultural engineering. 2026. 172 p. Tese (Doutorado em Engenharia Agrícola) - Universidade Federal de Lavras, Lavras, 2026.
dc.identifier.urihttps://repositorio.ufla.br/handle/1/61086
dc.language.isoen_US
dc.publisherUniversidade Federal de Lavras
dc.publisher.collegeEscola de Engenharia (EENG)
dc.publisher.countrybrasil
dc.publisher.initialsUFLA
dc.publisher.programPrograma de Pós-Graduação em Engenharia Agrícola
dc.rightsAttribution 3.0 Brazilen
dc.rights.urihttp://creativecommons.org/licenses/by/3.0/br/
dc.subjectSynthetic data
dc.subjectCholesky decomposition
dc.subjectArabica coffee
dc.subjectSensory analysis
dc.subjectMachine learning
dc.subjectCafé Arábica - Análise sensorial
dc.subjectAnálise sensorial
dc.subjectDados sintéticos
dc.subjectAprendizado de máquina
dc.subject.cnpqEngenharia Agrícola
dc.titleA methodology for synthetic data generation and validation applied to agricultural engineering
dc.title.alternativeUma metodologia para geração e validação de dados sintéticos aplicada à engenharia agrícola
dc.typedissertação

Arquivos

Pacote original

Agora exibindo 1 - 2 de 2
Carregando...
Imagem de Miniatura
Nome:
Texto completo
Tamanho:
18.37 MB
Formato:
Adobe Portable Document Format
Carregando...
Imagem de Miniatura
Nome:
Impactos da pesquisa
Tamanho:
590.75 KB
Formato:
Adobe Portable Document Format

Licença do pacote

Agora exibindo 1 - 1 de 1
Carregando...
Imagem de Miniatura
Nome:
license.txt
Tamanho:
955 B
Formato:
Item-specific license agreed upon to submission
Descrição: