Skip to main content An official website of the United States government Here's how you know Here's how you know Official websites use .gov A .gov website belongs to an official government organization in the United States. Secure .gov websites use HTTPS A lock ( Lock Locked padlock icon ) or https:// means you've safely connected to the .gov website. Share sensitive information only on official, secure websites. Search Log in Dashboard Publications Account settings Log out Search… Search NCBI Primary site navigation Search Logged in as: Dashboard Publications Account settings Log in Search PMC Full-Text Archive Search in PMC Journal List User Guide PERMALINK Copy As a library, NLM provides access to scientific literature. Inclusion in an NLM database does not imply endorsement of, or agreement with, the contents by NLM or the National Institutes of Health. Learn more: PMC Disclaimer | PMC Copyright Notice Rev Bras Epidemiol . 2026 Apr 10;29:e260013. doi: 10.1590/1980-549720260013 Search in PMC Search in PubMed View in NLM Catalog Add to search View full-text in Portuguese Use of synthetic population to assess alcohol abuse in small areas Crizian Saar Gomes Crizian Saar Gomes I Universidade Federal de Minas Gerais, Post-Graduation Program in Public Health, School of Medicine - Belo Horizonte (MG), Brazil. Formal Analysis, Conceptualization, Writing - original draft, Writing - review & editing Find articles by Crizian Saar Gomes I , Regina Tomie Ivata Bernal Regina Tomie Ivata Bernal II Universidade Federal de Minas Gerais, Post-Graduation Program in Nursing, School of Nursing - Belo Horizonte (MG), Brazil. Formal Analysis, Conceptualization, Writing - original draft, Writing - review & editing Find articles by Regina Tomie Ivata Bernal II , Larissa Fortunato Araújo Larissa Fortunato Araújo III Universidade Federal do Ceará, Health Sciences Center, Department of Community Health - Fortaleza (CE), Brazil. Conceptualization, Writing - review & editing Find articles by Larissa Fortunato Araújo III , Celso Renato França Júnior Celso Renato França Júnior IV Universidade Federal de Minas Gerais, Post-Graduation Program in Computer Science, Institute of Exact Sciences - Belo Horizonte (MG), Brazil. Formal Analysis, Conceptualization, Data curation, Writing - review & editing, Methodology Find articles by Celso Renato França Júnior IV , Samuel Norberto Alves Samuel Norberto Alves V Universidade Federal de Minas Gerais, School of Medicine - Belo Horizonte (MG), Brazil. Formal Analysis, Conceptualization, Writing - review & editing, Methodology Find articles by Samuel Norberto Alves V , Juliana Bottoni de Souza Juliana Bottoni de Souza VI Universidade Federal de Minas Gerais, School of Nursing - Belo Horizonte (MG), Brazil. Conceptualization, Writing - review & editing Find articles by Juliana Bottoni de Souza VI , Flora Vitória Serena Oliveira Baldi Flora Vitória Serena Oliveira Baldi VI Universidade Federal de Minas Gerais, School of Nursing - Belo Horizonte (MG), Brazil. Conceptualization, Writing - review & editing Find articles by Flora Vitória Serena Oliveira Baldi VI , Marcos André Gonçalves Marcos André Gonçalves VII Universidade Federal de Minas Gerais, Institute Exact Sciences, Department of Computer Science - Belo Horizonte (MG), Brazil. Conceptualization, Writing - review & editing, Methodology, Supervision Find articles by Marcos André Gonçalves VII , Jussara Marques Almeida Jussara Marques Almeida VII Universidade Federal de Minas Gerais, Institute Exact Sciences, Department of Computer Science - Belo Horizonte (MG), Brazil. Conceptualization, Writing - review & editing, Methodology, Supervision Find articles by Jussara Marques Almeida VII , Deborah Carvalho Malta Deborah Carvalho Malta VIII Universidade Federal de Minas Gerais, School of Nursing, Department of Maternal-Child Nursing and Public Health - Belo Horizonte (MG), Brazil. Project administration, Conceptualization, Writing - original draft, Funding acquisition, Supervision Find articles by Deborah Carvalho Malta VIII Author information Article notes Copyright and License information I Universidade Federal de Minas Gerais, Post-Graduation Program in Public Health, School of Medicine - Belo Horizonte (MG), Brazil. II Universidade Federal de Minas Gerais, Post-Graduation Program in Nursing, School of Nursing - Belo Horizonte (MG), Brazil. III Universidade Federal do Ceará, Health Sciences Center, Department of Community Health - Fortaleza (CE), Brazil. IV Universidade Federal de Minas Gerais, Post-Graduation Program in Computer Science, Institute of Exact Sciences - Belo Horizonte (MG), Brazil. V Universidade Federal de Minas Gerais, School of Medicine - Belo Horizonte (MG), Brazil. VI Universidade Federal de Minas Gerais, School of Nursing - Belo Horizonte (MG), Brazil. VII Universidade Federal de Minas Gerais, Institute Exact Sciences, Department of Computer Science - Belo Horizonte (MG), Brazil. VIII Universidade Federal de Minas Gerais, School of Nursing, Department of Maternal-Child Nursing and Public Health - Belo Horizonte (MG), Brazil. CORRESPONDING AUTHOR: Deborah Carvalho Malta. Avenida Professor Alfredo Balena, 190, Santa Efigênia, CEP 30130-100, Belo Horizonte (MG), Brazil. E-mail: [email protected] CONFLICT OF INTERESTS: nothing to declare ASSOCIATE EDITOR: Vera Maria Vieira Paniz https://orcid.org/0000-0003-3186-9991 SCIENTIFIC EDITOR: Francisco Chiaravalloti Neto https://orcid.org/0000-0003-2686-8740 Roles Crizian Saar Gomes : Formal Analysis, Conceptualization, Writing - original draft, Writing - review & editing Regina Tomie Ivata Bernal : Formal Analysis, Conceptualization, Writing - original draft, Writing - review & editing Larissa Fortunato Araújo : Conceptualization, Writing - review & editing Celso Renato França Júnior : Formal Analysis, Conceptualization, Data curation, Writing - review & editing, Methodology Samuel Norberto Alves : Formal Analysis, Conceptualization, Writing - review & editing, Methodology Juliana Bottoni de Souza : Conceptualization, Writing - review & editing Flora Vitória Serena Oliveira Baldi : Conceptualization, Writing - review & editing Marcos André Gonçalves : Conceptualization, Writing - review & editing, Methodology, Supervision Jussara Marques Almeida : Conceptualization, Writing - review & editing, Methodology, Supervision Deborah Carvalho Malta : Project administration, Conceptualization, Writing - original draft, Funding acquisition, Supervision Received 2025 Jul 18; Revised 2025 Nov 1; Accepted 2025 Nov 27; Collection date 2026. This is an open-access article distributed under the terms of the Creative Commons Attribution License PMC Copyright notice PMCID: PMC13078829 PMID: 41983819 ABSTRACT Objective: This study evaluated the use of synthetic populations, generated by conditional generative adversarial networks (cGAN), to estimate abusive alcohol consumption in small areas of Belo Horizonte (MG). Methods: Data from the Vigitel survey from 2006 to 2018 were used. Sociodemographic and lifestyle variables were considered, and the synthetic records were assigned to nine vulnerability clusters. Results: The inclusion of synthetic data reduced standard errors and narrowed confidence intervals, especially in more vulnerable areas. Higher prevalence was observed in less vulnerable areas. Conclusions: The approach proved promising for overcoming representativeness limitations and enhancing risk factor monitoring, but it still depends on the quality of the original data, may introduce biases, and requires external validation and cautious use. Keywords: Abusive alcohol consumption, Generative adversarial networks, Synthetic population, Population surveys INTRODUCTION The analysis of risk factors in small areas is essential for understanding social inequalities in health and for supporting the planning of local public policies. Brazil, despite advances in surveillance, still faces difficulties in producing valid estimates in small areas because of the high costs and challenges in data collection, which make the implementation of representative surveys unfeasible. The Surveillance System of Risk and Protective Factors for Chronic Diseases by Telephone Survey (Vigitel), an annual telephone survey covering the state capitals, is one of the main sources of monitoring, but its dependence on landlines limits representativeness in more vulnerable groups, such as low-income populations and residents of peripheral areas 1 . These limitations have stimulated the development of alternative methodologies to increase accuracy in small areas. The international literature suggests the use of approaches such as Bayesian models, multilevel models, and small area estimation techniques 2 . More recently, innovations in artificial intelligence, such as conditional generative adversarial networks (cGANs), have been applied to generate realistic synthetic populations, enabling simulations that expand the analytical capacity in contexts where real data are scarce, confidential, or difficult to obtain 3 . This study aimed to evaluate the use of synthetic populations, generated by cGANs, to assess alcohol abuse in small areas of Belo Horizonte (MG), exploring its methodological potential and discussing its implications. METHODS This was an ecological study conducted with Vigitel data for Belo Horizonte (MG), between 2006 and 2018. The addresses of the interviewees, provided by the operators, were georeferenced and linked to the National Register of Addresses for Statistical Purposes, allowing association with census tracts 2 . Abusive alcohol consumption was defined as consuming four or more drinks on one occasion for women and five or more for men 4 . Nine vulnerability clusters (LO-0, LO-1, MD-0, MD-1, HI-0, HI-1, HI-2, VH-0, VH-1) were considered “small areas,” derived from the four categories of the Health Vulnerability Index (HVI) (Low, Medium, High, and Very High). This regrouping strategy was proposed in a previous study 5 to reduce the variability of HVI. Synthetic populations were generated by cGAN networks implemented in PyTorch, following the classic GAN architecture, where the generator and discriminator are jointly optimized in an adversarial scenario. Training occurred over 1,024 epochs, with a batch size of 500, a learning rate of 2×10⁻⁴, and the Adam optimizer (default parameters). The stopping criterion was based solely on the number of epochs, without early stopping, and the adopted loss function was the canonical adversarial loss (minimax log loss). The variables used were sociodemographic and lifestyle variables (e.g., sex, age, race/skin color, education level, and daily fruit consumption), selected for their epidemiological relevance and availability in the database. Between 5,000 and 100,000 synthetic records were generated per cluster, from which subsamples of 700 individuals were selected (defined on the basis of the stabilization of the standard error at ~1%) and incorporated, using supervised models such as XGBoost, into the Vigitel database in the high and very high vulnerability clusters, totaling 3,500 interviews per period ( Table 1 ). The similarity between real and synthetic distributions was determined using the KSComplement index. The prevalence and 95% confidence interval (95%CI) were estimated by cluster and period (2006-2009; 2010-2013; 2014-2018), considering post-stratification weights. Differences between clusters within the same period were assessed by the non-overlapping of the 95%CIs. Table 1. Sample size of the Surveillance System for Risk and Protective Factors for Chronic Diseases by Telephone Survey (Vigitel) and the synthetic population by cluster and by period. Cluster 2006 to 2009 2010 to 2013 2014 to 2018 Real population Synthetic population Total Real population Synthetic population Total Real population Synthetic population Total 1-LO-0 1,723 - 1,723 1,453 - 1,453 1,570 - 1,570 2-LO-1 1,228 - 1,228 1,112 - 1,112 946 - 946 3-MD-0 1,477 - 1,477 1,297 - 1,297 1,485 - 1,485 4-MD-1 1,547 - 1,547 1,628 - 1,628 1,721 - 1,721 5-HI-0 324 700 1,024 356 700 1,056 376 700 1,076 6-HI-1 130 700 830 158 700 858 197 700 897 7-HI-2 601 700 1,301 683 700 1,383 763 700 1,463 8-VH-0 93 700 793 104 700 804 107 700 807 9-VH-1 199 700 899 242 700 942 244 700 944 Total 7,322 3,500 10,822 7,033 3,500 10,533 7,409 3,500 10,909 Open in a new tab LO: low; MD: medium; HI: high; VH: very high; The study was approved by the Research Ethics Committee of the Federal University of Minas Gerais (Opinion No. 6.538.883). Data Availability Statement: Data are available upon request from the corresponding author. RESULTS The prevalence of alcohol abuse was consistently higher in the less vulnerable clusters across all periods analyzed, both in the real data (T1 28.2%; 95%CI 25.1-31.3; T2 26.2%; 95%CI 23.0-29.4; T3 27.0%; 95%CI 22.9-31.0) and in the synthetic data (T1 27.4%; 95%CI 24.7-30.0; T2 27.7%; 95%CI 24.7-30.7; T3 26.5%; 95%CI 22.6-30.5) ( Table 2 ). Table 2. Prevalence of abusive alcohol consumption in the nine vulnerability clusters for the periods 2006 to 2009 (T1), 2010 to 2013 (T2) and 2014 to 2018 (T3). Real population Real+synthetic population T1 % (95%CI) SE T2 % (95%CI) SE T3 % (95%CI) SE T1 % (95%CI) SE T2 % (95%CI) SE T3 % (95%CI) SE LO-0 23.5 (21.0-25.9) 1.2 23.9 (21.2-26.7) 1.4 24.1 (21.2-26.9) 1.5 23.3 (21.12-25.4) 1.1 24.1 (21.51-26.6) 1.3 24.0 (21.3-26.7) 1.4 LO-1 28.2 (25.1-31.3) 1.6 26.2 (23.0-29.4) 1.6 27.0 (22.9-31.0) 2.1 27.4 (24.7-30.0) 1.4 27.7 (24.7-30.7) 1.5 26.5 (22.6-30.5) 2.0 MD-0 20.3 (17.7-22.9) 1.3 20.7 (18.0-23.4) 1.4 21.7 (18.9-24.5) 1.4 19.5 (17.3-21.6) 1.1 21.8 (19.3-24.3) 1.3 21.7 (19.1-24.3) 1.3 MD-1 20.5 (18.0-22.9) 1.2 18.9 (16.7-21.2) 1.1 20.9 (18.3-23.4) 1.3 20.1 (17.9-22.3) 1.1 19.1 (17.0-21.1) 1.1 20.6 (18.1-23.0) 1.2 HI-0 11.2 (7.4-14.9) 1.9 18.4 (13.5-23.3) 2.5 18.3 (13.1-23.5) 2.6 12.0 (9.8-14.2) 1.1 17.5 (14.8-20.2) 1.4 18.9 (15.9-21.8) 1.5 HI-1 17.2 (9.3-25.1) 4.0 19.6 (11.8-27.5) 4.0 21.6 (14.4-28.9) 3.7 17.8 (14.9-20.6) 1.5 19.1 (15.9-22.3) 1.6 21.3 (18.0-24.6) 1.7 HI-2 17.0 (13.3-20.7) 1.9 15 (11.6-18.4) 1.7 15.2 (11.8-18.5) 1.7 17.6 (15.3-19.9) 1.2 14.6 (12.4-16.8) 1.1 15.2 (12.9-17.5) 1.2 VH-0 15.9 (7.3-24.4) 4.3 20.3 (10.3-30.3) 5.1 9.5 (3.2-15.7) 3.2 15.3(12.4-18.2) 1.5 20.6 (17.3-23.9) 1.7 9.2 (6.7-11.7) 1.3 VH-1 14.5 (8.8-20.2) 2.9 14.0 (9.2-18.8) 2.4 15.2 (9.3-21.1) 3.0 14.3 (11.7-16.9) 1.3 14.9 (12.1-17.7) 1.4 15.2 (12.3-18.0) 1.5 Open in a new tab SE: standard error; LO: low; MD: medium; HI: high; VH: very high; 95%CI: 95% confidence interval; KSComplement: 0.96. The inclusion of synthetic populations in the database reduced standard errors and narrowed confidence intervals, especially in the most vulnerable areas, where the original samples were smaller. For example, in cluster VH-0 and period T1, the 95%CI ranged 7.3-24.4% (SE=4.3) with real data and 12.4-18.2% (SE=1.5) with synthetic data ( Table 2 ). The KSComplement index of 0.96 confirmed high similarity between the observed and synthetic distributions. DISCUSSION The findings reinforce that the use of synthetic populations generated by cGAN can mitigate limitations of population-based surveys by producing more accurate estimates in small areas. The higher consumption of alcoholic beverages in less vulnerable areas is consistent with the national and international literature 4 , 6 and can be explained by the fact that, in higher-income contexts, there is not only greater financial availability for the purchase of alcoholic beverages, but also a greater supply of commercial establishments and social spaces that encourage drinking. In addition, cultural and behavioral aspects, such as the valuing of social practices linked to alcohol consumption, contribute to reinforcing this pattern. On the other hand, more vulnerable areas may show a lower reported prevalence, but are more exposed to harms resulting from alcohol because of the lower availability of health services and social support. The use of synthetic data contributed to greater stability of the estimates, reducing variability between periods and proving to be a promising approach to mitigate the scarcity of collected data and reduce distribution and representation biases in small geographical areas. Despite the methodological advances, the technique should be considered exploratory. Its application depends on the quality of the real data, may introduce biases related to modeling, and requires external validation in different contexts 7 . Ethical issues emerge from the use of synthetic data, including the need for transparency and safeguards against inappropriate uses. When compared to traditional small-area approaches, such as Bayesian and multilevel models, cGANs show competitive and complementary performance 2 , 7 . However, its adoption requires additional studies that evaluate sensitivity, generalization, and replication in other populations. Thus, it is concluded that synthetic populations represent an innovative resource for health surveillance, but their use must be accompanied by critical assessments, continuous validation, and ethical reflection. This innovation can support the formulation of more precise and equitable public policies, provided it is used responsibly. ACKNOWLEDGMENTS: Deborah Carvalho Malta thanks the National Council for Scientific and Technological Development (CNPQ) for the scholarship received (CNPQ 0-0202/771013). Crizian Saar Gomes thanks the São Paulo State Research Support Foundation (FAPESP) for the research scholarship (Process No. 2024/07524-0). Funding Statement This study was funded by the following sources: Center for Innovation and Artificial Intelligence for Health (CI-IA Saúde), partly with funds from the São Paulo Resarch Foundation (FAPESP), Process No. 2020/09866-4, from the Minas Gerais Research Support Foundation (FAPEMIG), Process No. PPE-00030-21, and from UNIMED Belo Horizonte; CNPq and Decit/SECTICS/MS (call 21/2023); Fapemig call B01/2025 (APQ 02385-25); Health Ministry/National Health Fund (TED No. 114/2024 - “Artificial Intelligence Center for Health - NIAR-Saúde - UFMG”). Footnotes HOW TO CITE THIS ARTICLE: Gomes CS, Bernal TRI, Araújo LF, França Júnior CR, Alves SN, Souza JB, et al. Use of synthetic population to assess alcohol abuse in small areas. Rev Bras Epidemiol. 2026; 29: e260013. https://doi.org/10.1590/1980-549720260013 FUNDING: This study was funded by the following sources: Center for Innovation and Artificial Intelligence for Health (CI-IA Saúde), partly with funds from the São Paulo Resarch Foundation (FAPESP), Process No. 2020/09866-4, from the Minas Gerais Research Support Foundation (FAPEMIG), Process No. PPE-00030-21, and from UNIMED Belo Horizonte; CNPq and Decit/SECTICS/MS (call 21/2023); Fapemig call B01/2025 (APQ 02385-25); Health Ministry/National Health Fund (TED No. 114/2024 - “Artificial Intelligence Center for Health - NIAR-Saúde - UFMG”). REFERENCES 1. Malta DC, Silva MMA, Moura L, Morais OL., Neto A implantação do Sistema de Vigilância de Doenças Crônicas Não Transmissíveis no Brasil, 2003 a 2015: alcances e desafios. Rev Bras Epidemiol. 2017;20(4):661–675. doi: 10.1590/1980-5497201700040009. [ DOI ] [ PubMed ] [ Google Scholar ] 2. Bernal RTI, Carvalho QH, Pell JP, Leyland AH, Dundas R, Barreto ML, et al. A methodology for small area prevalence estimation based on survey data. Int J Equity Health. 2020;19(200):124–124. doi: 10.1186/s12939-020-01220-5. [ DOI ] [ PMC free article ] [ PubMed ] [ Google Scholar ] 3. Murtaza H, Ahmed M, Khan NF, Murtaza G, Zafar S, Bano A. Synthetic data generation: state of the art in health care domain. Comput Sci Rev. 2023;48:100546–100546. doi: 10.1016/j.cosrev.2023.100546. [ DOI ] [ Google Scholar ] 4. World Health Organization . Global status report on alcohol and health 2018. Geneva: WHO; 2018. [ Google Scholar ] 5. Faria TMTR, Vasconcelos MA, Bernal RTI, Mielke GI, Souza JB, Gomes CS, et al. Improving the mapping of leisure-time physical activity inequities: the use of artificial intelligence to advance estimates of small-areas in Brazil. Public Health. 2025;243:105727–105727. doi: 10.1016/j.puhe.2025.105727. [ DOI ] [ PubMed ] [ Google Scholar ] 6. Malta DC, Silva AG, Prates EJS, Alves FTA, Cristo EB, Machado IE. Convergência no consumo abusivo de álcool nas capitais brasileiras entre sexos, 2006 a 2019: o que dizem os inquéritos populacionais. Rev Bras Epidemiol. 2021;24:e210022.SUPL1. doi: 10.1590/1980-549720210022.supl.1. [ DOI ] [ PubMed ] [ Google Scholar ] 7. Kang J, Kim Y, Imran MM, Jung GS, Kim YB. Generating population synthesis using a diffusion model. WSC ‘23: Proceedings of the Winter Simulation Conference. 2024:2944–2955. https://dl.acm.org/doi/10.5555/3643142.3643387 [ Google Scholar ] Rev Bras Epidemiol. 2026 Apr 10;29:e260013. [Article in Portuguese] doi: 10.1590/1980-549720260013.2 Uso de população sintética para estimativas de consumo abusivo de bebidas alcoólicas em pequenas áreas Crizian Saar Gomes Crizian Saar Gomes I Universidade Federal de Minas Gerais, Programa de Pós-Graduação em Saúde Pública, Faculdade de Medicina - Belo Horizonte (MG), Brasil. Análise formal, Conceituação, Escrita- primeira redação, Escrita - revisão e edição Find articles by Crizian Saar Gomes I , Regina Tomie Ivata Bernal Regina Tomie Ivata Bernal II Universidade Federal de Minas Gerais, Programa de Pós-Graduação em Enfermagem, Escola de Enfermagem - Belo Horizonte (MG), Brasil. Análise formal, Conceituação, Curadoria de dados, Escrita - revisão e edição, Metodologia Find articles by Regina Tomie Ivata Bernal II , Larissa Fortunato Araújo Larissa Fortunato Araújo III Universidade Federal do Ceará, Centro de Ciências da Saúde, Departamento de Saúde Comunitária - Fortaleza (CE), Brasil. Conceituação, Escrita - revisão e edição Find articles by Larissa Fortunato Araújo III , Celso Renato França Júnior Celso Renato França Júnior IV Universidade Federal de Minas Gerais, Programa de Pós-Graduação em Ciências da Computação, Instituto de Ciências Exatas - Belo Horizonte (MG), Brasil. Análise formal, Conceituação, Curadoria de dados, Escrita - revisão e edição, Metodologia Find articles by Celso Renato França Júnior IV , Samuel Norberto Alves Samuel Norberto Alves V Universidade Federal de Minas Gerais, Faculdade de Medicina - Belo Horizonte (MG), Brasil. Análise formal, Conceituação, Escrita - revisão e edição, Metodologia Find articles by Samuel Norberto Alves V , Juliana Bottoni de Souza Juliana Bottoni de Souza VI Universidade Federal de Minas Gerais, Escola de Enfermagem - Belo Horizonte (MG), Brasil. Conceituação, Escrita - revisão e edição Find articles by Juliana Bottoni de Souza VI , Flora Vitória Serena Oliveira Baldi Flora Vitória Serena Oliveira Baldi VI Universidade Federal de Minas Gerais, Escola de Enfermagem - Belo Horizonte (MG), Brasil. Conceituação, Escrita - revisão e edição Find articles by Flora Vitória Serena Oliveira Baldi VI , Marcos André Gonçalves Marcos André Gonçalves VII Universidade Federal de Minas Gerais, Instituto de Ciências Exatas, Departamento de Ciência da Computação - Belo Horizonte (MG), Brasil. Conceituação, Escrita - revisão e edição, Metodologia, Supervisão Find articles by Marcos André Gonçalves VII , Jussara Marques Almeida Jussara Marques Almeida VII Universidade Federal de Minas Gerais, Instituto de Ciências Exatas, Departamento de Ciência da Computação - Belo Horizonte (MG), Brasil. Conceituação, Escrita - revisão e edição, Metodologia, Supervisão Find articles by Jussara Marques Almeida VII , Deborah Carvalho Malta Deborah Carvalho Malta VIII Universidade Federal de Minas Gerais, Escola de Enfermagem, Departamento de Enfermagem Materno-Infantil e Saúde Pública - Belo Horizonte (MG), Brasil. Administração do projeto, Conceituação, Escrita- primeira redação, Obtenção de financiamento, Supervisão Find articles by Deborah Carvalho Malta VIII Author information Article notes Copyright and License information I Universidade Federal de Minas Gerais, Programa de Pós-Graduação em Saúde Pública, Faculdade de Medicina - Belo Horizonte (MG), Brasil. II Universidade Federal de Minas Gerais, Programa de Pós-Graduação em Enfermagem, Escola de Enfermagem - Belo Horizonte (MG), Brasil. III Universidade Federal do Ceará, Centro de Ciências da Saúde, Departamento de Saúde Comunitária - Fortaleza (CE), Brasil. IV Universidade Federal de Minas Gerais, Programa de Pós-Graduação em Ciências da Computação, Instituto de Ciências Exatas - Belo Horizonte (MG), Brasil. V Universidade Federal de Minas Gerais, Faculdade de Medicina - Belo Horizonte (MG), Brasil. VI Universidade Federal de Minas Gerais, Escola de Enfermagem - Belo Horizonte (MG), Brasil. VII Universidade Federal de Minas Gerais, Instituto de Ciências Exatas, Departamento de Ciência da Computação - Belo Horizonte (MG), Brasil. VIII Universidade Federal de Minas Gerais, Escola de Enfermagem, Departamento de Enfermagem Materno-Infantil e Saúde Pública - Belo Horizonte (MG), Brasil. AUTORA PARA CORRESPONDÊNCIA: Deborah Carvalho Malta. Avenida Professor Alfredo Balena, 190, Santa Efigênia, CEP 30130-100, Belo Horizonte (MG), Brasil. E-mail: [email protected] CONFLITO DE INTERESSES: nada a declarar EDITORA ASSOCIADA: Vera Maria Vieira Paniz https://orcid.org/0000-0003-3186-9991 EDITOR CIENTÍFICO: Francisco Chiaravalloti Neto https://orcid.org/0000-0003-2686-8740 Roles Crizian Saar Gomes : Análise formal, Conceituação, Escrita- primeira redação, Escrita - revisão e edição Regina Tomie Ivata Bernal : Análise formal, Conceituação, Curadoria de dados, Escrita - revisão e edição, Metodologia Larissa Fortunato Araújo : Conceituação, Escrita - revisão e edição Celso Renato França Júnior : Análise formal, Conceituação, Curadoria de dados, Escrita - revisão e edição, Metodologia Samuel Norberto Alves : Análise formal, Conceituação, Escrita - revisão e edição, Metodologia Juliana Bottoni de Souza : Conceituação, Escrita - revisão e edição Flora Vitória Serena Oliveira Baldi : Conceituação, Escrita - revisão e edição Marcos André Gonçalves : Conceituação, Escrita - revisão e edição, Metodologia, Supervisão Jussara Marques Almeida : Conceituação, Escrita - revisão e edição, Metodologia, Supervisão Deborah Carvalho Malta : Administração do projeto, Conceituação, Escrita- primeira redação, Obtenção de financiamento, Supervisão Collection date 2026. PMC Copyright notice RESUMO Objetivos: Este estudo avaliou o uso de populações sintéticas, geradas por redes generativas adversariais condicionais (cGAN), para estimar o consumo abusivo de bebidas alcoólicas em pequenas áreas de Belo Horizonte (MG). Métodos: Usou-se dados do Sistema de Vigilância de Fatores de Risco e Proteção para Doenças Crônicas por Inquérito Telefônico (Vigitel) de 2006 a 2018. Foram consideradas variáveis sociodemográficas e de estilo de vida, e os registros sintéticos foram atribuídos a nove clusters de vulnerabilidade. Resultados: A inclusão de dados sintéticos reduziu erros padrão e estreitou intervalos de confiança, sobretudo em áreas mais vulneráveis. Observou-se maior prevalência em áreas menos vulneráveis. Conclusões: A abordagem mostrou-se promissora para superar limitações de representatividade e ampliar o monitoramento de fatores de risco, mas ainda depende da qualidade dos dados originais, pode introduzir vieses e requer validação externa e uso cauteloso. Palavras-chaves: Consumo abusivo de bebidas alcóolicas, Redes generativas adversariais, População sintética, Inquéritos populacionais INTRODUÇÃO A análise de fatores de risco em pequenas áreas é essencial para compreender desigualdades sociais em saúde e para subsidiar o planejamento de políticas públicas locais. O Brasil, apesar de avanços em vigilância, ainda apresenta dificuldades na produção de estimativas válidas em pequenas áreas, em razão dos altos custos e dos desafios na coleta de dados, que inviabilizam a implementação de inquéritos representativos. O Sistema de Vigilância de Fatores de Risco e Proteção para Doenças Crônicas por Inquérito Telefônico (Vigitel), inquérito telefônico anual que abrange as capitais, constitui uma das principais fontes de monitoramento, mas sua dependência de linhas fixas limita a representatividade em grupos mais vulneráveis, como populações de baixa renda e moradores de áreas periféricas 1 . Essas limitações têm estimulado o desenvolvimento de metodologias alternativas para aumentar a precisão em pequenas áreas. A literatura internacional sugere o uso de abordagens como modelos bayesianos, multinível e técnicas de estimação em pequenas áreas 2 . Mais recentemente, inovações em inteligência artificial, como as redes generativas adversariais condicionais (cGAN), vêm sendo aplicadas para gerar populações sintéticas realistas, permitindo simulações que ampliam a capacidade de análise em contextos em que os dados reais são escassos, confidenciais ou de difícil obtenção 3 . Este estudo teve como objetivo avaliar o uso de populações sintéticas, geradas por cGAN, para estimar o consumo abusivo de bebidas alcoólicas em pequenas áreas de Belo Horizonte (MG), explorando seu potencial metodológico e discutindo suas implicações. MÉTODOS Trata-se de um estudo ecológico realizado com dados do Vigitel para Belo Horizonte (MG), entre 2006 e 2018. Os endereços dos entrevistados, fornecidos pelas operadoras, foram georreferenciados e vinculados ao Cadastro Nacional de Endereços para Fins Estatísticos, permitindo a associação a setores censitários 2 . O consumo abusivo de bebidas alcoólicas foi definido pelo consumo de quatro ou mais doses em uma ocasião para mulheres e cinco ou mais para homens 4 . Consideraram-se como “pequenas áreas” nove clusters de vulnerabilidade (BA-0, BA-1, MD-0, MD-1, EL-0, EL-1, EL-2, ME-0, ME-1), derivados das quatro categorias do Índice de Vulnerabilidade à Saúde (IVS) (Baixo, Médio, Elevado e Muito Elevado). Essa estratégia de reagrupamento foi proposta em estudo anterior 5 para reduzir a variabilidade do IVS. As populações sintéticas foram geradas por redes cGAN implementadas em PyTorch, seguindo a arquitetura clássica de GAN, em que gerador e discriminador são otimizados conjuntamente em cenário adversarial. O treinamento ocorreu por 1.024 épocas, com batch size de 500, taxa de aprendizado de 2 × 10⁻ 4 e otimizador Adam (parâmetros padrão). O critério de parada baseou-se apenas no número de épocas, sem early stopping , e a função de perda adotada foi a adversarial canônica ( minimax log loss ). As variáveis utilizadas foram sociodemográficas e de estilo de vida (por exemplo, sexo, idade, raça/cor, escolaridade e consumo diário de frutas), selecionadas pela relevância epidemiológica e disponibilidade na base. Foram gerados entre 5 mil e 100 mil registros sintéticos por cluster , dos quais subamostras de 700 indivíduos foram selecionadas (definidas com base na estabilização do erro padrão em ~1%) e incorporadas, por modelos supervisionados como o XGBoost, à base do Vigitel nos clusters de elevada e muito elevada vulnerabilidade, totalizando 3.500 entrevistas por período ( Tabela 1 ). A similaridade entre distribuições reais e sintéticas foi avaliada pelo índice KSComplement. Tabela 1. Tamanho da amostra do Sistema de Vigilância de Fatores de Risco e Proteção para Doenças Crônicas por Inquérito Telefônico (Vigitel) e da população sintética por cluster e por período. Cluster 2006 a 2009 2010 a 2013 2014 a 2018 População real População sintética Total População real População sintética Total População real População sintética Total 1-BA-0 1.723 - 1.723 1.453 - 1.453 1.570 - 1.570 2-BA-1 1.228 - 1.228 1.112 - 1.112 946 - 946 3-MD-0 1.477 - 1.477 1.297 - 1.297 1.485 - 1.485 4-MD-1 1.547 - 1.547 1.628 - 1.628 1.721 - 1.721 5-EL-0 324 700 1.024 356 700 1.056 376 700 1.076 6-EL-1 130 700 830 158 700 858 197 700 897 7-EL-2 601 700 1.301 683 700 1.383 763 700 1.463 8-ME-0 93 700 793 104 700 804 107 700 807 9-ME-1 199 700 899 242 700 942 244 700 944 Total 7.322 3.500 10.822 7.033 3.500 10.533 7.409 3.500 10.909 Open in a new tab A prevalência e os intervalos de confiança de 95% (IC95%) foram estimados por cluster e período (2006-2009; 2010-2013; 2014-2018), considerando-se os pesos de pós-estratificação. As diferenças entre clusters em um mesmo período foram avaliadas pela não sobreposição dos IC95%. O estudo foi aprovado pelo Comitê de Ética em Pesquisa da Universidade Federal de Minas Gerais (Parecer n o 6.538.883). Declaração De Disponibilidade De Dados: Dados disponíveis mediante solicitação ao pesquisador correspondente. RESULTADOS As prevalências de consumo abusivo de bebidas alcoólicas foram consistentemente mais elevadas nos clusters de menor vulnerabilidade, em todos os períodos analisados, tanto nos dados reais (T1 28,2%; IC95% 25,1-31,3; T2 26,2%; IC95% 23,0-29,4; T3 27,0%; IC95% 22,9-31,0) quanto nos sintéticos (T1 27,4%; IC95% 24,7-30,0; T2 27,7%; IC95% 24,7-30,7; T3 26,5%; IC95% 22,6-30,5) ( Tabela 2 ). Tabela 2. Prevalência de consumo abusivo de bebidas alcoólicas nos nove clusters de vulnerabilidade para os períodos 2006 a 2009 (T1), 2010 a 2013 (T2) e 2014 a 2018 (T3). População real População real+sintética T1 % (IC95%) EP T2 % (IC95%) EP T3 % (IC95%) EP T1 % (IC95%) EP T2 % (IC95%) EP T3 % (IC95%) EP BA-0 23,5 (21,0-25,9) 1,2 23,9 (21,2-26,7) 1,4 24,1 (21,2-26,9) 1,5 23,3 (21,12-25,4) 1,1 24,1 (21,51-26,6) 1,3 24,0 (21,3-26,7) 1,4 BA-1 28,2 (25,1-31,3) 1,6 26,2 (23,0-29,4) 1,6 27,0 (22,9-31,0) 2,1 27,4 (24,7-30,0) 1,4 27,7 (24,7-30,7) 1,5 26,5 (22,6-30,5) 2,0 MD-0 20,3 (17,7-22,9) 1,3 20,7 (18,0-23,4) 1,4 21,7 (18,9-24,5) 1,4 19,5 (17,3-21,6) 1,1 21,8 (19,3-24,3) 1,3 21,7 (19,1-24,3) 1,3 MD-1 20,5 (18,0-22,9) 1,2 18,9 (16,7-21,2) 1,1 20,9 (18,3-23,4) 1,3 20,1 (17,9-22,3) 1,1 19,1 (17,0-21,1) 1,1 20,6 (18,1-23,0) 1,2 EL-0 11,2 (7,4-14,9) 1,9 18,4 (13,5-23,3) 2,5 18,3 (13,1-23,5) 2,6 12,0 (9,8-14,2) 1,1 17,5 (14,8-20,2) 1,4 18,9 (15,9-21,8) 1,5 EL-1 17,2 (9,3-25,1) 4,0 19,6 (11,8-27,5) 4,0 21,6 (14,4-28,9) 3,7 17,8 (14,9-20,6) 1,5 19,1 (15,9-22,3) 1,6 21,3 (18,0-24,6) 1,7 EL-2 17,0 (13,3-20,7) 1,9 15 (11,6-18,4) 1,7 15,2 (11,8-18,5) 1,7 17,6 (15,3-19,9) 1,2 14,6 (12,4-16,8) 1,1 15,2 (12,9-17,5) 1,2 ME-0 15,9 (7,3-24,4) 4,3 20,3 (10,3-30,3) 5,1 9,5 (3,2-15,7) 3,2 15,3 (12,4-18,2) 1,5 20,6 (17,3-23,9) 1,7 9,2 (6,7-11,7) 1,3 ME-1 14,5 (8,8-20,2) 2,9 14,0 (9,2-18,8) 2,4 15,2 (9,3-21,1) 3,0 14,3 (11,7-16,9) 1,3 14,9 (12,1-17,7) 1,4 15,2 (12,3-18,0) 1,5 Open in a new tab EP: erro padrão; BA: baixo; MD: médio; EL: elevado; ME: muito elevado; IC95%: intervalo de confiança de 95%; KSComplement: 0.96. A inclusão de populações sintéticas na base reduziu os erros padrão e estreitou intervalos de confiança, principalmente nas áreas mais vulneráveis, onde as amostras originais eram menores. Por exemplo, no cluster ME-0 e período T1, o IC95% variou de 7,3-24,4% (EP=4,3) com dados reais e de 12,4-18,2% (EP=1,5) com dados sintéticos ( Tabela 2 ). O índice KSComplement de 0,96 confirmou alta similaridade entre as distribuições observadas e sintéticas. DISCUSSÃO Os achados reforçam que o uso de populações sintéticas geradas por cGAN pode mitigar limitações de inquéritos de base populacional ao produzir estimativas mais precisas em pequenas áreas. O maior consumo de bebidas alcóolicas em áreas menos vulneráveis está em consonância com a literatura nacional e internacional 4 , 6 e pode ser explicado pelo fato de que, em contextos de maior renda, há não apenas maior disponibilidade financeira para a aquisição de bebidas alcoólicas, mas também maior oferta de estabelecimentos comerciais e espaços de socialização que estimulam o consumo. Além disso, aspectos culturais e comportamentais, como a valorização de práticas sociais vinculadas ao uso de bebidas alcoólicas, contribuem para reforçar esse padrão. Por outro lado, áreas mais vulneráveis podem apresentar menor prevalência relatada, mas estão mais expostas a agravos decorrentes do consumo, pela menor disponibilidade de serviços de saúde e suporte social. A utilização de dados sintéticos contribuiu para maior estabilidade das estimativas, reduzindo a variabilidade entre períodos e mostrando-se uma abordagem promissora para mitigar a escassez de dados coletados e reduzir vieses de distribuição e representação em pequenas áreas geográficas. Apesar dos avanços metodológicos, a técnica deve ser considerada exploratória. Sua aplicação depende da qualidade dos dados reais, pode introduzir vieses relacionados à modelagem e exige validação externa em diferentes contextos 7 . Questões éticas emergem do uso de dados sintéticos, incluindo a necessidade de transparência e de salvaguardas contra usos inadequados. Quando comparadas a abordagens tradicionais de pequenas áreas, como modelos bayesianos e multinível, as cGAN apresentam desempenho competitivo e complementar 2 , 7 . No entanto, sua adoção requer estudos adicionais que avaliem sensibilidade, generalização e replicação em outras populações. Assim, conclui-se que populações sintéticas representam um recurso inovador para vigilância em saúde, mas seu uso deve ser acompanhado de avaliações críticas, validação contínua e reflexão ética. Essa inovação pode apoiar a formulação de políticas públicas mais precisas e equitativas, desde que utilizada de forma responsável. AGRADECIMENTOS: Deborah Carvalho Malta agradece ao Conselho Nacional de Desenvolvimento Científico e Tecnológico (CNPQ) pela bolsa recebida (CNPQ 0-0202/771013). Crizian Saar Gomes agradece a Fundação de Amparo à Pesquisa do Estado de São Paulo (FAPESP) pela bolsa pesquisa (processo no 2024/07524-0). Footnotes COMO CITAR ESSE ARTIGO: Gomes CS, Bernal TRI, Araújo LF, França Júnior CR, Alves SN, Souza JB, et al. Uso de população sintética para estimativas de consumo abusivo de bebidas alcoólicas em pequenas áreas. Rev Bras Epidemiol. 2026; 29: e260013. https://doi.org/10.1590/1980-549720260013.2 FONTE DE FINANCIAMENTO: Este estudo foi financiado com os seguintes recursos: Centro de Inovação e Inteligência Artificial para Saúde (CI-IA Saúde), em parte com recursos da Fundação de Amparo à Pesquisa do Estado de São Paulo (FAPESP), Processo no 2020/09866-4, da Fundação de Amparo à Pesquisa de Minas Gerais (FAPEMIG), Processo no PPE-00030-21, e da UNIMED Belo Horizonte; CNPq e Decit/SECTICS/MS (chamada 21/2023); Fapemig chamada B01/2025 (APQ 02385-25); Ministério da Saúde/Fundo Nacional de Saúde (TED no 114/2024 - “Núcleo de Inteligência Artificial para Saúde - NIAR-Saúde - UFMG” ) Associated Data This section collects any data citations, data availability statements, or supplementary materials included in this article. Data Availability Statement Data are available upon request from the corresponding author. Dados disponíveis mediante solicitação ao pesquisador correspondente. Articles from Revista Brasileira de Epidemiologia (Brazilian Journal of Epidemiology) are provided here courtesy of Associação Brasileira de Saúde Coletiva ACTIONS View on publisher site PDF (266.4 KB) Cite Collections Permalink PERMALINK Copy RESOURCES Similar articles Cited by other articles Links to NCBI Databases Cite Copy Download .nbib .nbib Format: AMA APA MLA NLM Add to Collections Create a new collection Add to an existing collection Name your collection * Choose a collection Unable to load your collection due to an error Please try again Add Cancel Follow NCBI NCBI on X (formerly known as Twitter) NCBI on Facebook NCBI on LinkedIn NCBI on GitHub NCBI RSS feed Connect with NLM NLM on X (formerly known as Twitter) NLM on Facebook NLM on YouTube National Library of Medicine 8600 Rockville Pike Bethesda, MD 20894 Web Policies FOIA HHS Vulnerability Disclosure Help Accessibility Careers NLM NIH HHS USA.gov Back to Top