A methodology for synthetic data generation and validation applied to agricultural engineering
| dc.contributor.advisor | Magalhães, Ricardo Rodrigues | |
| dc.contributor.co-advisor | Ferreira, Danton Diego | |
| dc.contributor.referee | Ferreira, Danton Diego | |
| dc.contributor.referee | Lima, Danilo Alves de | |
| dc.contributor.referee | Lacerda, Wilian Soares | |
| dc.contributor.referee | Vitor, Giovanni Bernardes | |
| dc.creator | Brandão Junior, Luiz Carlos | |
| dc.creator.Lattes | http://lattes.cnpq.br/4992193748825216 | |
| dc.creator.orcid | https://orcid.org/0009-0004-8513-0863 | |
| dc.date.accessioned | 2026-08-14T20:37:42Z | |
| dc.date.issued | 2026-07-09 | |
| dc.description.abstract | The scarcity of high-quality experimental data, coupled with the high costs of laboratory and sensory analyses, are significant barriers to the development of computational modeling and artificial intelligence in the field of Agricultural Sciences. This thesis introduces a reverse engineering framework for generating synthetic data based on Cholesky decomposition, which can reconstruct multivariate distributions while preserving statistical properties and structural dependence between variables. As a case study, the technique was employed in a model for the sensory quality of Arabica coffee using a public dataset from the Coffee Quality Institute (𝑛 = 207 samples). The method was divided into four stages: (i) data extraction and preprocessing (ii) statistical synthesis preserving first and second order moments (iii) multiple validation of statistical fidelity and (iv) evaluation of predictive power via the Train Synthetic, Test Real (TSTR) protocol. The results showed high structural fidelity, obtaining a correlation matrix similarity of 96.20% and a Kolmogorov-Smirnov (KS) test similarity of 85.81%; all variables exceeded the technical acceptance threshold of 70%. In RF regression, only the models trained with synthetic data achieved R² = 0.9498, a Mean Absolute Error (MAE) of only 0.216, and 100% accuracy within a margin of error of ±10%. For the ordinal classification of sensory quality, the approach achieved 89.37% accuracy and a Weighted Quadratic Kappa Coefficient of 0.9558, showing almost perfect agreement with the standards of the Specialty Coffee Association (SCA). As its main scientific contribution, this thesis establishes a reverse engineering framework for reconstructing synthetic databases from aggregated statistics, demonstrating that the simultaneous preservation of statistical fidelity and predictive utility can be achieved without the use of deep generative models. The proposed approach expands the possibilities for secure data sharing, reduces dependence on costly experimentation, and offers a computationally efficient and easily reproducible solution with high potential for technology transfer to applications in Agricultural Engineering, Agronomy, and other areas that depend on reliable experimental databases. | |
| dc.description.acaoclimatica | 2. Uso sustentável da água e do solo | |
| dc.description.acaoclimatica | 6. Eficiência energética ou inovação ambiental | |
| dc.description.areastematicasdaextensao | Meio ambiente | |
| dc.description.areastematicasdaextensao | Saúde | |
| dc.description.areastematicasdaextensao | Tecnologia e produção | |
| dc.description.concentration | Máquinas e Mecanização Agrícola | |
| dc.description.ods | ODS 2: Fome zero e agricultura sustentável | |
| dc.description.ods | ODS 3: Saúde e bem-estar | |
| dc.description.ods | ODS 7: Energia limpa e acessível | |
| dc.description.ods | ODS 9: Indústria, inovação e infraestrutura | |
| dc.description.ods | ODS 12: Consumo e produção responsáveis | |
| dc.description.ods | ODS 13: Ação contra a mudança global do clima | |
| dc.description.ods | ODS 15: Vida terrestre | |
| dc.description.researchLine | Engenharia Agrícola | |
| dc.description.resumo | A escassez de dados experimentais de qualidade, juntamente com os altos custos de análises laboratoriais e sensoriais, são barreiras significativas para o desenvolvimento da modelagem computacional e da inteligência artificial na área das Ciências Agrárias. Esta tese introduz um framework de engenharia reversa para a geração de dados sintéticos baseado na decomposição de Cholesky, que pode reconstruir distribuições multivariadas enquanto preserva as propriedades estatísticas e a dependência estrutural entre as variáveis. Como caso de estudo, a técnica foi empregada em um modelo para a qualidade sensorial do café Arábica com um conjunto de dados público do Coffee Quality Institute (𝑛 = 207 amostras). O método foi dividido em quatro estágios: (i) extração e pré-processamento de dados (ii) síntese estatística preservando momentos de ordem um e dois (iii) validação múltipla de fidelidade estatística e (iv) avaliação do poder preditivo via o protocolo Train Synthetic, Test Real (TSTR). Os resultados mostraram uma elevada fidelidade estrutural, obtendo-se similaridade da matriz de correlação 96,20% e similaridade pelo teste de Kolmogorov-Smirnov (KS) 85.81%, todas as variáveis ultrapassaram o limiar técnico de aceitação de 70%. Na regressão RF, apenas os modelos treinados com dados sintéticos alcançaram 𝑅2 = 0, 9498, Erro Médio Absoluto (MAE) de apenas 0,216 e precisão de 100% dentro da margem de erro de ±10%. Para a classificação ordinal da qualidade sensorial, a abordagem atingiu 89,37% de acurácia e (Weighted Quadratic) Kappa Coeficiente de 0,9558, mostrando concordância quase perfeita com os padrões da Specialty Coffee Asscociation (SCA). Como principal contribuição científica, esta tese estabelece um framework de engenharia reversa para reconstrução de bases de dados sintéticas a partir de estatísticas agregadas, demonstrando que a preservação simultânea da fidelidade estatística e da utilidade preditiva pode ser alcançada sem o emprego de modelos generativos profundos. A abordagem proposta amplia as possibilidades de compartilhamento seguro de dados, reduz a dependência de experimentação onerosa e oferece uma solução computacionalmente eficiente e de fácil reprodução, com elevado potencial de transferência tecnológica para aplicações em Engenharia Agrícola, Agronomia e demais áreas que dependem de bases de dados experimentais confiáveis. | |
| dc.description.sponsorship | Coordenação de Aperfeiçoamento de Pessoal de Nível Superior (CAPES) | |
| dc.description.tipodeimpacto | Sociais | |
| dc.description.tipodeimpacto | Tecnológico | |
| dc.description.tipodeimpacto | Econômicos | |
| dc.identifier.citation | BRANDÃO JÚNIOR, Luiz Carlos. A methodology for synthetic data generation and validation applied to agricultural engineering. 2026. 172 p. Tese (Doutorado em Engenharia Agrícola) - Universidade Federal de Lavras, Lavras, 2026. | |
| dc.identifier.uri | https://repositorio.ufla.br/handle/1/61086 | |
| dc.language.iso | en_US | |
| dc.publisher | Universidade Federal de Lavras | |
| dc.publisher.college | Escola de Engenharia (EENG) | |
| dc.publisher.country | brasil | |
| dc.publisher.initials | UFLA | |
| dc.publisher.program | Programa de Pós-Graduação em Engenharia Agrícola | |
| dc.rights | Attribution 3.0 Brazil | en |
| dc.rights.uri | http://creativecommons.org/licenses/by/3.0/br/ | |
| dc.subject | Synthetic data | |
| dc.subject | Cholesky decomposition | |
| dc.subject | Arabica coffee | |
| dc.subject | Sensory analysis | |
| dc.subject | Machine learning | |
| dc.subject | Café Arábica - Análise sensorial | |
| dc.subject | Análise sensorial | |
| dc.subject | Dados sintéticos | |
| dc.subject | Aprendizado de máquina | |
| dc.subject.cnpq | Engenharia Agrícola | |
| dc.title | A methodology for synthetic data generation and validation applied to agricultural engineering | |
| dc.title.alternative | Uma metodologia para geração e validação de dados sintéticos aplicada à engenharia agrícola | |
| dc.type | dissertação |
Arquivos
Licença do pacote
1 - 1 de 1
Carregando...
- Nome:
- license.txt
- Tamanho:
- 955 B
- Formato:
- Item-specific license agreed upon to submission
- Descrição:
