Modello con classi latenti
In statistica, un modello con classi latenti è un modello di clustering multivariato per dati discreti. Esso assicura che i dati siano generati da una mistura di distribuzioni discrete, all'interno di ognuna delle quali le variabili risultino indipendenti. Viene così chiamato perché la classe alla quale appartiene ogni istanza non è osservata (ossia è latente).
Si ricorre alla cosiddetta Latent Class Analysis (LCA) per trovare gruppi o sotto-tipi di istanze in dati multivariati categorici. Tali gruppi o sotto-tipi sono detti "classi latenti".[1][2]
Si può decidere di ricorrere alla LCA per comprendere meglio i dati a fronte di problemi come quello di seguito descritto: sono stati registrati i sintomi a, b, c e d in diversi pazienti/casi a cui sono state diagnosticate le malattie X, Y e Z. La malattia X è associata ai sintomi a, b e c, la malattia Y è collegata ai sintomi b, c e d e la malattia Z è da ricondursi ai sintomi a, c e d.
In questa situazione, la LCA cercherebbe di individuare la presenza di classi latenti (ovvero le patologie), scoprendo così modelli di associazione tra i sintomi. Come nell'analisi fattoriale, la LCA può essere utilizzata anche per classificare istanze in base alle loro probabilità di appartenenza alle classi, stimate mediante il criterio della massima verosimiglianza.[1][3]
Il criterio fondamentale per risolvere problemi mediante LCA consiste nell'identificare classi latenti in cui le correlazioni osservate tra i sintomi risultino praticamente nulle. Ciò è dovuto al fatto che, all'interno di ciascuna classe, le malattie responsabili dei sintomi creano una struttura di dipendenze. Di conseguenza, i sintomi diventano condizionatamente indipendenti ovvero, nota la classe alla quale appartiene un caso, i sintomi non sono più correlati tra loro.[1]
Modello
All'interno di ciascuna classe latente, le variabili osservate sono statisticamente indipendenti: si tratta di un aspetto essenziale della modellizzazione delle classi latenti. Di solito, le variabili osservate sono statisticamente dipendenti. Introducendo la variabile latente, si ripristina l'indipendenza nel senso che, all'interno delle classi, le variabili sono indipendenti (indipendenza locale). Pertanto, la correlazione tra le variabili osservate è spiegata dalle classi della variabile latente.[4]
In una delle sue forme, il modello si scrive come segue
dove è il numero di classi latenti e sono le cosiddette probabilità di reclutamento o incondizionate che dovrebbero sommarsi a uno. sono le probabilità marginali o condizionate.
Per un modello binario di classi latenti, la forma è
Questo modello binario è correlato all'analisi semantica latente probabilistica e alla fattorizzazione di matrici non negative.
Il modello di probabilità utilizzato nell'LCA è strettamente correlato al classificatore Naive Bayes. La differenza principale è che nella LCA per l'appartenenza di un individuo a una classe si usa una variabile latente, mentre nei classificatori Naive Bayes si usa un'etichetta osservata.
Metodi correlati
Esistono diversi metodi con nomi e utilizzi distinti ma che condividono una relazione comune. Ilclustering, come l'LCA, viene utilizzato per individuare nei dati gruppi di casi simili a unità tassonomiche (taxon). La stima di misture multivariate (MME) può essere applicata a dati continui e presuppone che tali dati derivino da una mistura di distribuzioni, come ad esempio un insieme di altezze derivanti da una mistura di uomini e donne. Se una stima multivariata di misture è vincolata in modo tale che le misure debbano essere non correlate all'interno di ciascuna distribuzione, viene definita analisi dei profili latenti. Modificata per gestire dati discreti, questa forma di analisi vincolata non è altro che la LCA. I modelli a tratti latenti discreti vincolano ulteriormente le classi a formarsi da segmenti di una singola dimensione, assegnando i membri alle classi in base a tale dimensione. Un esempio potrebbe essere l'assegnazione dei casi a classi sociali in base all'abilità o al merito.
In uno scenario più pratico, le variabili potrebbero essere le voci a scelta multipla di un questionario politico. In questo caso, i dati consistono in una tabella di contingenza a N vie con le risposte alle domande fornite da un certo numero di intervistati. In questo esempio, la variabile latente si riferisce alle opinioni politiche, mentre le classi latenti si riferiscono ai gruppi politici. Data l'appartenenza a un gruppo, le probabilità condizionate specificano la probabilità che vengano scelte determinate risposte.
Applicazioni
La LCA può essere utilizzata in molti settori, quali il collaborative filtering,[5] la Genetica comportamentale[6] e la valutazione dei test diagnostici.[7]
Note
- ^ a b c (EN) P.F. Lazarsfeld e N.W. Henry, Latent structure analysis, Boston, Houghton Mifflin, 1968.
- ^ (EN) A.K. Formann, Latent Class Analyse: Einführung in die Theorie und Anwendung [Latent class analysis: Introduction to theory and application], Weinheim, Beltz, 1984.
- ^ (EN) Thorsten Teichert, Das Latent-Ciass Verfahren zur Segmentierung von wahlbasierten Conjoint-annon. Befunde einer empirischen Anwendung, in Marketing ZFP, vol. 22, n. 3, 2000, pp. 227–240, DOI:10.15358/0344-1369-2000-3-227, ISSN 0344-1369.
- ^ (EN) Allan L. McCutcheon, Latent class analysis, Quantitative Applications in the Social Sciences Series No. 64., Thousand Oaks, California, SAGE Publications, 1987, ISBN 978-0-521-59451-6.
- ^ (EN) Kwok-Wai Cheung, Kwok-Ching Tsui e Jiming Liu, Extended latent class models for collaborative recommendation, in IEEE Transactions on Systems, Man, and Cybernetics - Part A: Systems and Humans, vol. 34, n. 1, 2004, pp. 143-148, DOI:10.1109/TSMCA.2003.818877.
- ^ (EN) L.J. Eaves et al., Analyzing twin resemblance in multisymptom data: genetic applications of a latent class model for symptoms of conduct disorder in juvenile boys, in Behavior Genetics, vol. 23, n. 1, 1993, pp. 5-19, DOI:10.1007/bf01067550, PMID 8476390.
- ^ (EN) M.L. Bermingham et al., Hui and Walter's latent-class model extended to estimate diagnostic test properties from surveillance data: a latent model for latent data, in Scientific Reports, vol. 5, n. 11861, 2015, Bibcode:2015NatSR...511861B, DOI:10.1038/srep11861, PMID 26148538.
Bibliografia
- (EN) Linda M. Collins e Stephanie T. Lanza, Latent class and latent transition analysis for the social, behavioral, and health sciences, New York, Wiley, 2010, ISBN 978-0-470-22839-5.
- (EN) Leo A. Goodman, Exploratory latent structure analysis using both identifiable and unidentifiable models, in Biometrika, vol. 61, n. 2, 1974, pp. 215-231, DOI:10.1093/biomet/61.2.215.
- (EN) Paul F. Lazarsfeld e Neil W. Henry, Latent Structure Analysis, 1968.
Collegamenti esterni
- Statistical Innovations, Home Page, 2016. Sito con software per LCA (Latent GOLD 5.1), demo, tutorial, guide-utente e articoli da scaricare. Include anche corsi online, FAQ e altro software correlato.
- The Methodology Center, Latent Class Analysis, centro di ricerca presso la Penn State University: con software gratuito e FAQ
- Latent Class Analysis di J. Uebersax, 2006. Sito con bibliografia, software, link e FAQ sulla LCA
Content Disclaimer
Informasi ini disarikan dari Wikipedia dan disajikan kembali untuk tujuan edukasi. Konten tersedia di bawah lisensi CC BY-SA 3.0. Kami tidak bertanggung jawab atas ketidakakuratan data yang bersumber dari kontribusi publik tersebut.
- The information displayed on this website is sourced in part or in whole from Wikipedia and has been adapted for the purpose of restating it. We strive to provide accurate and relevant information, however:
- There is no guarantee of absolute accuracy. Wikipedia is an open, collaborative project that can be edited by anyone, so information is subject to change.
- It is not intended to constitute professional advice. The content displayed is for informational and educational purposes only. For important decisions (e.g., medical, legal, or financial), please consult a professional.
- Content copyright. Wikipedia is licensed under the Creative Commons Attribution-ShareAlike License (CC BY-SA). This means that content may be reused with appropriate attribution and shared under a similar license.
- Responsible use. Any risk arising from the use of information from this website is entirely the responsibility of the user.