Use este identificador para citar ou linkar para este item: http://repositorio.ufla.br/jspui/handle/1/55736
Registro completo de metadados
Campo DCValorIdioma
dc.creatorDuarte, Alice Silva-
dc.date.accessioned2023-01-06T12:03:31Z-
dc.date.available2023-01-06T12:03:31Z-
dc.date.issued2023-01-05-
dc.date.submitted2022-09-22-
dc.identifier.citationDUARTE, A. S. Aplicações de métodos de seleção de variáveis em modelos de regressão. 2022. 70 p. Dissertação (Mestrado em Estatística e Experimentação Agropecuária)–Universidade Federal de Lavras, Lavras, 2022.pt_BR
dc.identifier.urihttp://repositorio.ufla.br/jspui/handle/1/55736-
dc.description.abstractRegression models are appliedtostudy a cause/effectrelationshipbetween a response variable and oneor more explanatory variables. Withtechnologicaladvances, the volume and dimension of theanalyzed data canbeincreasing. Whilethelargenumber of variables canincreasethepredictivecapacity of the model many of them variables cancontributelittle and generate a high computational cost. Then it maybenecessarytoselect variables and search for thosethathavethegreatestimpact in the model. In thisworkweevaluatethe use of variable selection methods in two case studies. The firstonewascarried out toevaluatethefrequency and food security of preschoolers in thecity of Lavras, MG. The responses analyzed in thisfirststage are data fromcategories of theBrazilianScale of Food Insecurity (EBIA) and the Food Frequency Questionnaire (FFQ), analyzedthroughlogistic models. Data werecollectedfrom 581 preschoolers and refertoabout 50 variables of differenttypes. The methods Stepwise, Lasso, the Purposeful Selection of Covariates (PSV) and Random Forest wereconsidered for the selection of variables. Subsequently, thelogistic models wereobtainedwiththe variables selectedbythesemethods. The models wereevaluated in terms of AIC. Amongtheevaluatedmethods, theonethatproducedthebestperforming model was Stepwise. The secondapplicationinvolved a high-dimensional data scenario, obtainedwiththe use of NIRS (Near infraredspectroscopy) in a problem of predicting food consumption, fromfeces of dairycows. The methods Stepwise, lasso and Random Forest wereconsidered for the selection of variables. Lasso performedwell in thecross-validationstudy. However, thisstudyislimitedtothe use of themethodsindependently. Other authorsobtainedgoodresultsapplying more thanonemethodsimultaneously. The contributions of this case study are thecomparisonamong lasso and Random Forest, usedseparately for the selection of variables in NIRS and thecomparisonbetweendifferenttypes of validations for the models obtainedusing lasso.pt_BR
dc.description.sponsorshipCoordenação de Aperfeiçoamento de Pessoal de Nível Superior (CAPES)pt_BR
dc.languageporpt_BR
dc.publisherUniversidade Federal de Lavraspt_BR
dc.rightsacesso abertopt_BR
dc.subjectAlta dimensionalidadept_BR
dc.subjectImportância de variáveispt_BR
dc.subjectLassopt_BR
dc.subjectFloresta aleatóriapt_BR
dc.subjectRegressão logísticapt_BR
dc.subjectHigh dimensionalitypt_BR
dc.subjectVariables importancept_BR
dc.subjectRandom forestpt_BR
dc.subjectLogistic regressionpt_BR
dc.subjectStepwisept_BR
dc.titleAplicações de métodos de seleção de variáveis em modelos de regressãopt_BR
dc.title.alternativeApplications of variable selection methods in regression modelspt_BR
dc.typedissertaçãopt_BR
dc.publisher.programPrograma de Pós-graduação em Estatística e Experimentação Agropecuáriapt_BR
dc.publisher.initialsUFLApt_BR
dc.publisher.countrybrasilpt_BR
dc.contributor.advisor1Oliveira, Izabela Regina Cardoso de-
dc.contributor.advisor-co1Lima, Renato Ribeiro de-
dc.contributor.referee1Ferreira, Daniel Furtado-
dc.contributor.referee2Pereira, Gustavo Henrique de Araujo-
dc.description.resumoModelos de regressão são técnicas utilizadas para estabelecer relação entre uma variável resposta e uma ou mais variáveis explicativas. Com o avanço tecnológico, o volume e a dimensão dos dados analisados pode ser cada vez maior. Enquanto, por um lado, o grande número de variáveis pode aumentar a capacidade preditiva do modelo, por outro muitas dessas variáveis podem contribuir pouco e gerar um alto custo computacional, fazendo-se necessário a seleção de variáveis e busca por aquelas que têm maior impacto no modelo. O objetivo deste trabalho foi avaliar o uso de métodos de seleção de variáveis em dois estudos de caso. O primeiro trata-se de um estudo de avaliação de frequência e segurança alimentar de pré-escolares do município de Lavras, MG. As respostas analisadas nessa primeira etapa são dadosde categorias da Escala Brasileira de Insegurança Alimentar (EBIA) e do Questionário de Frequência Alimentar (QFA), analisados por modelos logísticos. A amostra utilizada envolve dados de 581 pré-escolares caracterizados por cerca de 50 variáveis, de diferentes tipos. Foram considerados os métodos Stepwise, Lasso, o Purposeful Selection of Covariates (PSV) e Random Forest para seleção de variáveis. Posteriormente foram obtidos os modelos logísticos com as variáveis selecionadas por estes métodos. Os modelos foram avaliados em termos de AIC. Dentre os métodos avaliados o que produziu o modelo com melhor desempenho foi oStepwise. A segunda aplicação envolveu um cenário de dados de alta dimensão, obtidos com a utilização de NIRS (Near InfraredSpectroscopy) em um problema de predição de consumo alimentar, a partir de fezes de vacas leiteiras. Foram considerados os métodos Stepwise, lasso eRandom Forest para seleção de variáveis. O lasso apresentou bom desempenho no estudo de validação cruzada. No entanto, esse estudo se limita a utilização dos métodos de forma independente, já que outros autores obtiveram bons resultados aplicando mais de um método simultaneamente. As contribuições deste estudo de caso estão na comparação entre lasso e Random Forest, usados separadamente para seleção de variáveis em NIRS e a comparação entre diferentes tipos de validações para os modelos obtidos com o uso do lasso.pt_BR
dc.publisher.departmentDepartamento de Estatísticapt_BR
dc.subject.cnpqRegressão e Correlaçãopt_BR
dc.creator.Latteshttps://lattes.cnpq.br/4313284650448866pt_BR
Aparece nas coleções:Estatística e Experimentação Agropecuária - Mestrado (Dissertações)

Arquivos associados a este item:
Arquivo Descrição TamanhoFormato 
DISSERTAÇÃO_Aplicações de métodos de seleção de variáveis em modelos de regressão.pdf1,02 MBAdobe PDFVisualizar/Abrir


Os itens no repositório estão protegidos por copyright, com todos os direitos reservados, salvo quando é indicado o contrário.