Markerless motion capture

Il markerless motion capture (spesso abbreviato in MMC e traducibile come "analisi del movimento senza marcatori") è una tecnica utilizzata per registrare e analizzare il movimento umano senza applicare marcatori fisici o hardware sul corpo del soggetto.[1] A differenza dei sistemi optoelettronici tradizionali, che tracciano marcatori retroriflettenti o attivi, gli approcci senza marcatori si basano su dati video acquisiti da una o più telecamere e su software tipicamente basati sull'apprendimento profondo, per identificare e tracciare i punti anatomici del movimento umano.[2]

Il settore si è evoluto rapidamente a partire dai primi anni 2000, grazie ai progressi nella visione artificiale e alla disponibilità di numerosi dataset di addestramento.[3]

I sistemi sono in grado di stimare la postura dell'intero corpo in due o tre dimensioni e in tempo reale, utilizzando una o più telecamere a seconda del livello di precisione richiesto. Tale flessibilità ne ha consentito l'impiego in ambito clinico,[4][5] sportivo,[6][7] nell'intrattenimento[8] e nella robotica.[9]

Storia

Il primo studio sui modelli MMC fu pubblicato nel 1985[10] e rappresentò il primo tentativo di ricostruire la struttura corporea 3D di una persona a partire da una singola visuale. Nel 1996, diverse ricerche si concentrarono sull'estrazione di parti specifiche del corpo umano, come gli arti, individuati mediante tre telecamere sincronizzate associando primitive geometriche a contorni provenienti da più viste,[11] oppure sul tracciamento di testa e mani attraverso l'utilizzo di telecamere stereoscopiche e la modellazione con blob gaussiani.[3][12]

Nel 2000, l'individuazione di punti anatomici tramite bounding box consentì di estrapolare uno scheletro a 13 articolazioni.[13] Nel 2004, applicando la cinematica inversa, si ottenne uno scheletro a 16 articolazioni.[14] Nel 2008, l'elaborazione dei dati integrò rappresentazioni volumetriche a voxel per il tracciamento multi-vista, ricostruendo l'inviluppo visivo del corpo mediante blob gaussiani.[3][15]

La transizione verso l'apprendimento profondo

A partire dal 2013, l'apprendimento profondo è diventato l'approccio principale per la markerless motion capture. DeepPose è stato tra i primi sistemi a dimostrare le potenzialità di questa evoluzione, impiegando una cascata di reti neurali convoluzionali con funzioni di attivazione ReLU (Rectified Linear Unit) per affinare iterativamente le stime della posizione delle articolazioni.[3] Questo approccio ha raggiunto livelli di accuratezza e velocità superiori rispetto ai metodi precedenti, contribuendo alla diffusione su larga scala dell'apprendimento profondo nell'ambito della stima delle pose umane.[16]

Esempio di rilevamento di punti anatomici della posa del corpo umano in 3D mediante MediaPipe

Negli anni successivi sono stati rilasciati diversi framework open source. OpenPose, introdotto nel 2017, è stato uno dei primi sistemi a consentire la stima della posa 2D in tempo reale per più persone contemporaneamente.[17] Il sistema supporta il rilevamento di un massimo di 135 punti anatomici per individuo, coprendo l'intero corpo, inclusi mani, piedi e volto.[18]

Dal 2020, grandi aziende tecnologiche hanno fatto il loro ingresso nel settore con soluzioni proprie. Ad esempio, Google ha rilasciato il framework MediaPipe, progettato specificamente per l'esecuzione in tempo reale direttamente su dispositivi "edge", come gli smartphone.[19]

Principi di funzionamento

Una volta addestrato il modello, l'estrazione di punti anatomici da immagini o video grezzi prevede una sequenza di fasi di elaborazione:

  1. Acquisizione dei dati: le riprese vengono effettuate utilizzando una delle due principali categorie di hardware:
    • Fotocamere RGB standard, che acquisiscono informazioni sul colore ma non forniscono dati sulla profondità
    • Sensori sensibili alla profondità: tra cui le telecamere RGB-D, che acquisiscono sia informazioni visive che di profondità, nonché i dispositivi Time-of-Flight (ToF) e gli scanner LiDAR, che generano una mappa di profondità fisica[8].
  2. Rilevamento e isolamento: a seconda dell'architettura, il sistema elabora la scena utilizzando uno dei due metodi principali:[20][21]
    • Metodi "top-down": rilevano uno o più individui nel fotogramma, tipicamente tramite una bounding box, per poi stimare i punti anatomici di ciascuna persona.
    • Metodi "bottom-up": rilevano tutti i punti anatomici presenti nell'immagine senza una fase preliminare di rilevamento delle persone, procedendo direttamente alla mappatura anatomica.
  3. Mappatura anatomica: il modello analizza il soggetto e identifica la posizione di specifici punti chiave del corpo attraverso l'estrazione di caratteristiche.[3]
    Processo di mappatura anatomica
  4. Ricostruzione dello scheletro: in alcuni algoritmi, anziché restituire un insieme di coordinate indipendenti dei punti anatomici, questi sistemi collegano i punti identificati secondo un modello corporeo predefinito, producendo una rappresentazione scheletrica che rende esplicita la posa.[3]
Ricostruzione dello scheletro

Tecnologia e metodologia

La componente fondamentale della maggior parte dei sistemi *markerless* è un modello di apprendimento profondo, tipicamente una rete neurale convoluzionale (CNN) o un vision transformer addestrato a localizzare punti anatomici direttamente nello spazio bidimensionale dell'immagine. Qualora siano necessarie informazioni tridimensionali, si ricorre a un'ulteriore fase nota come "3D lifting".

Tale approccio varia in base alla configurazione delle telecamere impiegate:

  • Nei sistemi monoculari, che operano da un unico punto di vista, l'algoritmo deve affidarsi a reti neurali addestrate a inferire tale informazione sfruttando conoscenze apprese durante il training del modello, in merito alle proporzioni del corpo umano e alle posture tipiche.[22]
  • Nei sistemi multicamera è possibile ricavare le coordinate 3D mediante la geometria epipolare e la triangolazione, sfruttando le relazioni geometriche tra punti di vista calibrati.[23]

Dataset

Acquisizione di motion capture basato su marcatori

I modelli di apprendimento profondo per il markerless motion capture vengono addestrati e valutati utilizzando dataset che associano riprese video a dati affidabili (definiti come "ground truth"). Tali acquisizioni sono solitamente ottenute mediante sistemi di motion capture basati su marcatori, che rimangono lo standard di riferimento del settore.

Una strategia alternativa, adottata da diversi dataset, consiste nell'aggregare e unificare registrazioni esistenti da molteplici studi, creando così dataset di addestramento più ampi senza la necessità di nuove sessioni di acquisizione.

I primi benchmark, come Human3.m, sono stati registrati in studi controllati coinvolgendo un numero limitato di attori e utilizzando telecamere sincronizzate insieme a dati di riferimento basati su motion capture con marcatori.[24] I dataset successivi, come MPI-INF-3DHP, hanno introdotto acquisizioni multi-vista in scenari con green screen, nonché in ambienti interni ed esterni.[25] Il dataset 3D Poses in the Wild (3DPW) comprende attività quotidiane all'aperto registrate mediante una telecamera portatile abbinata a sensori inerziali indossati dai soggetti.[26]

Per la stima della postura 2D, il dataset COCO fornisce annotazioni dei punti anatomici su un elevato numero di immagini ed è comunemente utilizzato per addestrare o valutare le stime 2D di algoritmi come OpenPose.[27]

Un approccio diverso è adottato da AMASS, che unifica numerosi archivi esistenti basati su marcatori sotto il modello corporeo SMPL,[28] generando un vasto numero di dati di movimento per l'addestramento e la creazione di dati sintetici.[29] Inoltre, si trovano dataset completamente privi di marcatori come FreeMan, i quali puntano a migliorare la capacità di generalizzazione in contesti reali, utilizzando riprese multi-vista su soggetti e in ambienti eterogenei, senza ricorrere ad un hardware specializzato.[30]

Esistono infine dataset specifici per applicazioni cliniche. Alcuni ad esempio associano sequenze di movimento 3D a punteggi di gravità della patologia (come valutazioni basate sulla scala UPDRS), al fine di supportare la valutazione della qualità del movimento.[31]

Dataset usati per addestramento e benchmarking
Dataset Anno Tipo Setup camere
Human3.m[24] 2014 3D, indoor 4 camere + motion capture con marcatori
MPI-INF-3DHP[25] 2017 3D, indoor/outdoor Multi-vista, markerless motion capture come riferimento
COCO[27] 2014 2D, immagini Immagini singole
3DPW[26] 2018 3D, outdoor, nella natura Singola camera + sensori inerziali
AMASS[29] 2019 3D, sintetiche Archivio unificato
FreeMan[30] 2023 3D, nella natura Multi-vista

Bias demografico ed equità

I sistemi markerless possono ereditare i bias presenti nei dataset utilizzati per addestrare i propri modelli. Ad esempio è emerso che il dataset COCO sottorappresenta le donne, gli anziani e le persone con tonalità di pelle più scure.[32] Tale squilibrio può comportare minore accuratezza nel rilevamento di questi gruppi, causando preoccupazione laddove la tecnologia venga impiegata in contesti sensibili.[33][34]

Di conseguenza, le prestazioni dei sistemi sono sempre più spesso comunicate suddividendo i dati per sottogruppi demografici, anziché fornire un unico valore aggregato di accuratezza. Le "model card"[35] e le schede tecniche dei dataset sono due formati sviluppati proprio a questo scopo, la cui adozione è in costante crescita.

Sistemi disponibili

Gli algoritmi possono variare in base al numero di telecamere richieste e alla capacità di identificare un singolo soggetto o più contemporaneamente. Inoltre, esistono implementazioni sia sotto forma di framework di ricerca open source che di sistemi commerciali.

Framework open source

Un numero crescente di framework open source per il motion capture senza marcatori è reso disponibile al pubblico mediante piattaforme di condivisione come GitHub.

Markerless open source framework
Algoritmo 2D/3D Camere necessarie Multipersona
VNect[36] 3D 1 No
OpenPose[17] 2D 1 Yes
DeepLabCut[37] 2D 1 Yes
BlazePose[19] 3D 1 No
SportsCap[38] 3D 1 No
AlphaPose[39] 2D 1 Yes
YOLO-Pose[40] 2D 1 Yes
OpenCap[41] 3D 2 No

Sistemi commerciali

Oltre ai framework open source, il mercato offre una serie di sistemi commerciali progettati per ambienti in cui l'elevata fedeltà cinematica è necessaria. Tali soluzioni integrano hardware e software proprietari in configurazioni multicamera pre-calibrate. Tra le soluzioni commerciali di markerless motion capture figurano sistemi quali Vicon, OptiTrack, Qualisys, The Captury e Theia.

Applicazioni

La possibilità di impiego del markerless al di fuori dei tradizionali laboratori di analisi del movimento ha permesso l'adozione di questa tecnologia in diversi ambiti.

Clinica

Esempio di classificazione del cammino mediante l'uso della motion capture

In ambito clinico, i sistemi markerless sono stati studiati per diverse applicazioni, in particolare nel campo della riabilitazione. I pazienti affetti da malattia di Parkinson costituiscono uno dei gruppi più numerosi sottoposti a valutazioni di questo tipo; la maggior parte degli studi si è concentrata su parametri della deambulazione quali la lunghezza del passo, la cadenza e l'oscillazione delle braccia.[42]

Poiché non richiedono marcatori né dispositivi indossabili, tali valutazioni possono essere eseguite in normali ambienti clinici o presso il domicilio del paziente, riducendo così il divario tra le misurazioni controllate di laboratorio e la funzionalità nella vita reale.[43] Tuttavia, l'utilizzo in ambito clinico rimane cauto, in quanto gli studi di validazione hanno evidenziato che l'accuratezza nella rilevazione di alcune rotazioni articolari, in particolare a livello del tronco e dell'anca, può risultare ancora inferiore rispetto a quella offerta dai sistemi basati su marcatori.[44][45]

Sport

I sistemi markerless consentono di effettuare analisi biomeccaniche direttamente sul campo di gara o in piscina, anziché esclusivamente in studi dedicati al motion capture, rendendo così l'analisi del movimento più accessibile ad allenatori e scienziati dello sport senza interferire con i movimenti naturali dell'atleta.[46] La possibilità di acquisire dati su atleti di livello mondiale durante le competizioni in modo non invasivo, operazione in precedenza impossibile con le soluzioni basate su marcatori, ha aperto nuove prospettive di analisi. In questo contesto, il tennis è citato come uno sport in cui le infrastrutture di trasmissione esistenti potrebbero supportare l'analisi con un livello di fedeltà adeguato.[47]

Intrattenimento

L'industria dell'intrattenimento è stata tra le prime ad adottare le tecniche di motion capture e markerless. Tali tecnologie sono progressivamente utilizzate nella produzione cinematografica, televisiva e di videogiochi.

Nel settore dei videogiochi, Microsoft Kinect ha rappresentato una delle prime implementazioni su larga scala della tecnologia di tracciamento corporeo senza marcatori destinata al grande pubblico. Lanciato nel novembre 2010 come accessorio per Xbox 360, il dispositivo utilizzava una combinazione di videocamera RGB e un sensore di profondità a infrarossi per rilevare i movimenti dell'intero corpo senza l'ausilio di controller fisici, consentendo un'interazione basata sui gesti nell'ambiente domestico.[48] Ha venduto oltre otto milioni di unità nei primi sessanta giorni, stabilendo un Guinness dei primati come dispositivo di elettronica di consumo venduto più rapidamente all'epoca.[49]

Robotica e interazione uomo-robot

Nella ricerca robotica, il motion capture senza marcatori viene impiegato per studiare i movimenti umani durante attività collaborative, fornendo i dati cinematici necessari per programmare robot capaci di anticipare le azioni dell'uomo e di rispondervi in sicurezza.[50] Trova inoltre applicazione nei processi di "apprendimento per imitazione", in cui il robot acquisisce un'abilità motoria osservando una dimostrazione umana registrata tramite video standard, anziché attraverso la teleoperazione diretta.[51]

Limitazioni ed etica

Sfide tecniche

Nonostante i vantaggi, il markerless motion capture presenta diverse limitazioni tecniche che ne compromettono la precisione e l'affidabilità in condizioni reali:

  • L'occlusione è una delle fonti di errore più comuni.[52] Quando un'articolazione esce dal campo visivo, il sistema deve stimarne la posizione basandosi sul contesto.[53]
  • Le prestazioni degli algoritmi addestrati in ambienti indoor tendono a peggiorare quando vengono utilizzati in contesti caratterizzati da ombre marcate, luce solare diretta, scarsa luminosità o condizioni di illuminazione rapidamente variabili.[26][54] Zone sovraesposte o sottoesposte alla luce possono portare la sagoma del soggetto a confondersi con lo sfondo, riducendo l'accuratezza della fase di isolamento del soggetto, da cui dipende l'intero processo di elaborazione.[55]
  • Anche l'effetto di sfocatura da movimento costituisce una fonte di errore, specialmente durante movimenti rapidi. Tale limitazione è direttamente correlata alla frequenza di acquisizione della telecamera rispetto alla velocità del movimento. Se questa è insufficiente, i punti di riferimento articolari appaiono sfocati o allungati tra i fotogrammi, rendendo ambigua la loro posizione precisa.[56]
  • Un ulteriore vincolo è rappresentato dal costo computazionale. Eseguire un'inferenza accurata in tempo reale, in particolare integrando le riprese di più telecamere, richiede solitamente moderne GPU dedicate; spesso, le configurazioni multi-camera ne necessitano più di una. Ciò rende difficile l'implementazione in contesti privi di tale hardware, come ambienti esterni o dispositivi commerciali.[57]

Considerazioni sociali ed etiche

La tecnologia markerless solleva questioni di privacy diverse da quelle associate ai sistemi basati su marcatori. Poiché non richiede la collaborazione del soggetto o l'uso di strumentazione indossata dallo stesso, può in linea di principio essere impiegata in spazi pubblici, ambienti commerciali o contesti clinici, all'insaputa o senza il consenso dell'individuo. La capacità di estrarre informazioni biometriche e comportamentali da normali riprese video colloca tale tecnologia in una categoria distinta rispetto ai sistemi indossabili, nei quali la presenza del sensore è visibile al soggetto.[58]

Voci correlate

Note

  1. ^ (EN) Steffi L. Colyer, Murray Evans, Darren P. Cosker e Aki I.T. Salo, A Review of the Evolution of Vision-Based Motion Analysis and the Integration of Advanced Computer Vision Methods Towards Developing a Markerless System, in Sports Medicine - Open, vol. 4, n. 1, dicembre 2018, DOI:10.1186/s40798-018-0139-y, ISSN 2199-1170 (WC · ACNP), PMC 5986692, PMID 29869300.
  2. ^ (EN) Lars Mündermann, Stefano Corazza e Thomas P Andriacchi, The evolution of methods for the capture of human movement leading to markerless motion capture for biomechanical applications, in Journal of NeuroEngineering and Rehabilitation, vol. 3, n. 1, dicembre 2006, DOI:10.1186/1743-0003-3-6, ISSN 1743-0003 (WC · ACNP), PMC 1513229, PMID 16539701.
  3. ^ a b c d e f Pierre Nagorny, Bart Kevelham, Sylvain Chagué e Caecilia Charbonnier, A Comprehensive Review of Real-Time Multi-View Multi-Person Markerless Motion Capture, in ACM Computing Surveys, vol. 58, n. 3, 29 settembre 2025, p. 75:1–75:34, DOI:10.1145/3757733, ISSN 0360-0300 (WC · ACNP).
  4. ^ (EN) Łukasz Kidziński, Bryan Yang, Jennifer L. Hicks, Apoorva Rajagopal, Scott L. Delp e Michael H. Schwartz, Deep neural networks enable quantitative movement analysis using single-camera videos, in Nature Communications, vol. 11, n. 1, 13 agosto 2020, p. 4054, DOI:10.1038/s41467-020-17807-z, ISSN 2041-1723 (WC · ACNP), PMC 7426855, PMID 32792511.
  5. ^ (EN) Bradley Scott, Martin Seyres, Fraser Philp, Edward K. Chadwick e Dimitra Blana, Healthcare applications of single camera markerless motion capture: a scoping review, in PeerJ, vol. 10, 26 maggio 2022, p. e13517, DOI:10.7717/peerj.13517, ISSN 2167-8359 (WC · ACNP), PMC 9148557, PMID 35642200.
  6. ^ (EN) Graham Thomas, Rikke Gade, Thomas B. Moeslund, Peter Carr e Adrian Hilton, Computer vision for sports: Current applications and research topics, in Computer Vision and Image Understanding, vol. 159, giugno 2017, p. 3–18, DOI:10.1016/j.cviu.2017.04.011.
  7. ^ Konstantinos Rematas, Ira Kemelmacher-Shlizerman, Brian Curless e Steve Seitz, Soccer on Your Tabletop, in EEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2018 proceedings, IEEE, giugno 2018, p. 4738–4747, DOI:10.1109/CVPR.2018.00498, ISBN 978-1-5386-6420-9.
  8. ^ a b Jamie Shotton, Andrew Fitzgibbon, Mat Cook, Toby Sharp, Mark Finocchio, Richard Moore, Alex Kipman e Andrew Blake, Real-time human pose recognition in parts from single depth images, in IEEE Conference on Computer Vision and Pattern Recognition (CVPR) 2011, IEEE, giugno 2011, p. 1297–1304, DOI:10.1109/CVPR.2011.5995316, ISBN 978-1-4577-0394-2.
  9. ^ (EN) Hema Swetha Koppula, Rudhir Gupta e Ashutosh Saxena, Learning human activities and object affordances from RGB-D videos, in The International Journal of Robotics Research, vol. 32, n. 8, luglio 2013, p. 951–970, DOI:10.1177/0278364913478446, ISSN 0278-3649 (WC · ACNP).
  10. ^ Hsi-Jian Lee e Zen Chen, Determination of 3D human body postures from a single view, in Computer Vision, Graphics, and Image Processing, vol. 30, n. 2, 1º maggio 1985, p. 148–168, DOI:10.1016/0734-189X(85)90094-5, ISSN 0734-189X (WC · ACNP).
  11. ^ D.M. Gavrila e L.S. Davis, 3-D model-based tracking of humans in action: a multi-view approach, in CVPR 1996, IEEE, 1996, p. 73–80, DOI:10.1109/CVPR.1996.517056, ISBN 978-0-8186-7259-0.
  12. ^ A. Azarbayejani e A. Pentland, Real-time self-calibrating stereo person tracking using 3-D shape estimation from blob features, in Proceedings of the 13th International Conference on Pattern Recognition (ICPR), IEEE, 1996, p. 627–632 vol.3, DOI:10.1109/ICPR.1996.547022, ISBN 978-0-8186-7282-8.
  13. ^ S. Yonemoto, D. Arita e R.-I. Taniguchi, Real-time visually guided human figure control using IK-based motion synthesis, in Proceedings of the 5th IEEE Workshop on Applications of Computer Vision (WACV), IEEE Comput. Soc, 2000, p. 194–200, DOI:10.1109/WACV.2000.895422, ISBN 978-0-7695-0813-9.
  14. ^ N. Date, H. Yoshimoto, D. Arita e R. Taniguchi, Real-time human motion sensing based on vision-based inverse kinematics for interactive applications, in Proceedings of the 17th International Conference on Pattern Recognition (ICPR), IEEE, 2004, p. 318–321 Vol.3, DOI:10.1109/ICPR.2004.1334531, ISBN 978-0-7695-2128-2.
  15. ^ (EN) Fabrice Caillette, Aphrodite Galata e Toby Howard, Real-time 3-D human body tracking using learnt models of behaviour, in Computer Vision and Image Understanding, vol. 109, n. 2, febbraio 2008, p. 112–125, DOI:10.1016/j.cviu.2007.05.005.
  16. ^ Alexander Toshev e Christian Szegedy, DeepPose: Human Pose Estimation via Deep Neural Networks, in 2014 IEEE Conference on Computer Vision and Pattern Recognition, giugno 2014, p. 1653–1660, DOI:10.1109/CVPR.2014.214.
  17. ^ a b Zhe Cao, Tomas Simon, Shih-En Wei e Yaser Sheikh, Realtime Multi-person 2D Pose Estimation Using Part Affinity Fields, in IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), IEEE, luglio 2017, p. 1302–1310, DOI:10.1109/CVPR.2017.143, ISBN 978-1-5386-0457-1.
  18. ^ Abirami Vina, What is OpenPose? Exploring a milestone in pose estimation, su www.ultralytics.com, 17 giugno 2025. URL consultato il 30 giugno 2026.
  19. ^ a b Valentin Bazarevsky, Ivan Grishchenko, Karthik Raveendran, Tyler Zhu, Fan Zhang e Matthias Grundmann, BlazePose: On-device Real-time Body Pose tracking, arXiv, 17 giugno 2020, DOI:10.48550/arXiv.2006.10204, arXiv:2006.10204. URL consultato il 30 giugno 2026.
  20. ^ (EN) Monocular human pose estimation: A survey of deep learning-based methods, in Computer Vision and Image Understanding, vol. 192, 1º marzo 2020, p. 102897, DOI:10.1016/j.cviu.2019.102897, ISSN 1077-3142 (WC · ACNP).
  21. ^ (EN) Ronald Poppe, Vision-based human motion analysis: An overview, in Computer Vision and Image Understanding, vol. 108, n. 1-2, ottobre 2007, p. 4–18, DOI:10.1016/j.cviu.2006.10.016.
  22. ^ Angjoo Kanazawa, Michael J. Black, David W. Jacobs e Jitendra Malik, End-to-end Recovery of Human Shape and Pose, arXiv, 23 giugno 2018, DOI:10.48550/arXiv.1712.06584, arXiv:1712.06584. URL consultato il 2 luglio 2026.
  23. ^ Richard Hartley e Andrew Zisserman, Multiple view geometry in computer vision, 2ª ed., Cambridge, Cambridge University Press, 2003, ISBN 978-0-511-18618-9.
  24. ^ a b Catalin Ionescu, Dragos Papava, Vlad Olaru e Cristian Sminchisescu, Human3.6M: Large Scale Datasets and Predictive Methods for 3D Human Sensing in Natural Environments, in IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 36, n. 7, luglio 2014, p. 1325–1339, DOI:10.1109/TPAMI.2013.248, ISSN 0162-8828 (WC · ACNP).
  25. ^ a b Dushyant Mehta, Monocular 3D Human Pose Estimation In The Wild Using Improved CNN Supervision, su mpi-inf.mpg, 4 ottobre 2017. URL consultato il 1º luglio 2026.
  26. ^ a b c (EN) Timo von Marcard, Roberto Henschel1, Michael J. Black2, Bodo Rosenhahn1 e Gerard Pons-Moll3, Recovering Accurate 3D Human Pose in the Wild Using IMUs and a Moving Camera, in Computer Vision – ECCV 2018, vol. 11214, Cham, Springer International Publishing, 2018, p. 614–631, DOI:10.1007/978-3-030-01249-6_37, ISBN 978-3-030-01248-9. URL consultato il 4 luglio 2026.
  27. ^ a b Tsung-Yi Lin, Michael Maire, Serge Belongie, Lubomir Bourdev, Ross Girshick, James Hays, Pietro Perona, Deva Ramanan e C. Lawrence Zitnick, Microsoft COCO: Common Objects in Context, arXiv, 21 febbraio 2015, DOI:10.48550/arXiv.1405.0312, arXiv:1405.0312. URL consultato il 1º luglio 2026.
  28. ^ (EN) Matthew Loper, Naureen Mahmood, Javier Romero, Gerard Pons-Moll e Michael J. Black, SMPL: a skinned multi-person linear model, in ACM Transactions on Graphics, vol. 34, n. 6, 4 novembre 2015, p. 1–16, DOI:10.1145/2816795.2818013, ISSN 0730-0301 (WC · ACNP).
  29. ^ a b Naureen Mahmood, Nima Ghorbani, Nikolaus F. Troje, Gerard Pons-Moll e Michael Black, AMASS: Archive of Motion Capture As Surface Shapes, in Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), IEEE, ottobre 2019, p. 5441–5450, DOI:10.1109/ICCV.2019.00554, ISBN 978-1-7281-4803-8.
  30. ^ a b Jiong Wang, Fengyu Yang, Wenbo Gou, Bingliang Li, Danqi Yan, Ailing Zeng, Yijun Gao, Junle Wang e Yanqing Jing, FreeMan: Towards Benchmarking 3D Human Pose Estimation under Real-World Conditions, arXiv, 3 aprile 2024, DOI:10.48550/arXiv.2309.05073, arXiv:2309.05073. URL consultato il 1º luglio 2026.
  31. ^ Vida Adeli, Ivan Klabucar, Javad Rajabi, Benjamin Filtjens, Soroush Mehraban, Diwei Wang, Hyewon Seo, Trung-Hieu Hoang e Minh N. Do, CARE-PD: A Multi-Site Anonymized Clinical Dataset for Parkinson's Disease Gait Assessment, arXiv, 5 ottobre 2025, DOI:10.48550/arXiv.2510.04312, arXiv:2510.04312. URL consultato il 2 luglio 2026.
  32. ^ Alice Xiang, Exposing Limitations in Fairness Evaluations: Human Pose Estimation, su ai.sony, 17 aprile 2023. URL consultato il 30 giugno 2026.
  33. ^ Benjamin Wilson, Judy Hoffman e Jamie Morgenstern, Predictive Inequity in Object Detection, arXiv, 21 febbraio 2019, DOI:10.48550/arXiv.1902.11097, arXiv:1902.11097. URL consultato il 2 luglio 2026.
  34. ^ (EN) Sarah Tan, Rich Caruana, Giles Hooker e Yin Lou, Distill-and-Compare: Auditing Black-Box Models Using Transparent Model Distillation, in Proceedings of the 2018 AAAI/ACM Conference on AI, Ethics, and Society (AIES), ACM, 27 dicembre 2018, p. 303–310, DOI:10.1145/3278721.3278725, ISBN 978-1-4503-6012-8.
  35. ^ Margaret Mitchell, Simone Wu, Andrew Zaldivar, Parker Barnes, Lucy Vasserman, Ben Hutchinson, Elena Spitzer, Inioluwa Deborah Raji e Timnit Gebru, Model Cards for Model Reporting, in Proceedings of the Conference on Fairness, Accountability, and Transparency, 29 gennaio 2019, p. 220–229, DOI:10.1145/3287560.3287596.
  36. ^ Dushyant Mehta, Srinath Sridhar, Oleksandr Sotnychenko, Helge Rhodin, Mohammad Shafiei, Hans-Peter Seidel, Weipeng Xu, Dan Casas e Christian Theobalt, VNect: Real-time 3D Human Pose Estimation with a Single RGB Camera, in ACM Transactions on Graphics, vol. 36, n. 4, 31 agosto 2017, p. 1–14, DOI:10.1145/3072959.3073596, ISSN 0730-0301 (WC · ACNP).
  37. ^ (EN) Alexander Mathis, Pranav Mamidanna, Kevin M. Cury, Taiga Abe, Venkatesh N. Murthy, Mackenzie Weygandt Mathis e Matthias Bethge, DeepLabCut: markerless pose estimation of user-defined body parts with deep learning, in Nature Neuroscience, vol. 21, n. 9, settembre 2018, p. 1281–1289, DOI:10.1038/s41593-018-0209-y, ISSN 1546-1726 (WC · ACNP).
  38. ^ (EN) Xin Chen, Anqi Pang, Wei Yang, Yuexin Ma, Lan Xu e Jingyi Yu, SportsCap: Monocular 3D Human Motion Capture and Fine-Grained Understanding in Challenging Sports Videos, in International Journal of Computer Vision, vol. 129, n. 10, ottobre 2021, p. 2846–2864, DOI:10.1007/s11263-021-01486-4, ISSN 0920-5691 (WC · ACNP).
  39. ^ Hao-Shu Fang, Jiefeng Li, Hongyang Tang, Chao Xu, Haoyi Zhu, Yuliang Xiu, Yong-Lu Li e Cewu Lu, AlphaPose: Whole-Body Regional Multi-Person Pose Estimation and Tracking in Real-Time, arXiv, 7 novembre 2022, DOI:10.48550/arXiv.2211.03375, arXiv:2211.03375. URL consultato il 30 giugno 2026.
  40. ^ Debapriya Maji, Soyeb Nagori, Manu Mathew e Deepak Poddar, YOLO-Pose: Enhancing YOLO for Multi Person Pose Estimation Using Object Keypoint Similarity Loss, arXiv, 14 aprile 2022, DOI:10.48550/arXiv.2204.06806, arXiv:2204.06806. URL consultato il 30 giugno 2026.
  41. ^ (EN) Scott D. Uhlrich, Antoine Falisse, Łukasz Kidziński, Julie Muccini, Michael Ko, Akshay S. Chaudhari, Jennifer L. Hicks e Scott L. Delp, OpenCap: Human movement dynamics from smartphone videos, in PLOS Computational Biology, vol. 19, n. 10, 19 ottobre 2023, p. e1011462, DOI:10.1371/journal.pcbi.1011462, ISSN 1553-7358 (WC · ACNP), PMC 10586693, PMID 37856442.
  42. ^ (EN) Winnie W.T. Lam, Yuk Ming Tang e Kenneth N.K. Fong, A systematic review of the applications of markerless motion capture (MMC) technology for clinical measurement in rehabilitation, in Journal of NeuroEngineering and Rehabilitation, vol. 20, n. 1, 2 maggio 2023, DOI:10.1186/s12984-023-01186-9, ISSN 1743-0003 (WC · ACNP), PMC 10155325, PMID 37131238.
  43. ^ (EN) Logan Wade, Laurie Needham, Polly McGuigan e James Bilzon, Applications and limitations of current markerless motion capture methods for clinical gait biomechanics, in PeerJ, vol. 10, 25 febbraio 2022, p. e12995, DOI:10.7717/peerj.12995, ISSN 2167-8359 (WC · ACNP), PMC 8884063, PMID 35237469.
  44. ^ Sofia Scataglini, Eveline Abts, Cas Van Bocxlaer, Maxime Van den Bussche, Sara Meletani e Steven Truijen, Accuracy, Validity, and Reliability of Markerless Camera-Based 3D Motion Capture Systems versus Marker-Based 3D Motion Capture Systems in Gait Analysis: A Systematic Review and Meta-Analysis, in Sensors, vol. 24, n. 11, 6 giugno 2024, p. 3686, DOI:10.3390/s24113686, ISSN 1424-8220 (WC · ACNP), PMC 11175331, PMID 38894476.
  45. ^ (EN) Florent Varcin e Mark G. Boocock, The accuracy, validity and reliability of Theia3D markerless motion capture for studying the biomechanics of human movement: A systematic review, in Artificial Intelligence in Medicine, vol. 173, marzo 2026, p. 103332, DOI:10.1016/j.artmed.2025.103332.
  46. ^ (EN) Bahman Adlou, Christopher Wilburn e Wendi Weimar, Motion Capture Technologies for Athletic Performance Enhancement and Injury Risk Assessment: A Review for Multi-Sport Organizations, in Sensors, vol. 25, n. 14, 13 luglio 2025, p. 4384, DOI:10.3390/s25144384, ISSN 1424-8220 (WC · ACNP), PMC 12299843, PMID 40732512.
  47. ^ Desmond Boey, Olivier Girard, Marcus Lee, Bruce Elliott e Machar Reid, Unlocking the potential of video-based markerless motion analysis to study world-class sporting performance, in Journal of Sports Sciences, vol. 44, n. 10, 19 maggio 2026, p. 1261–1274, DOI:10.1080/02640414.2025.2576412, ISSN 0264-0414 (WC · ACNP), PMID 41140067.
  48. ^ Jamie Shotton, Andrew Fitzgibbon, Mat Cook, Toby Sharp, Mark Finocchio, Richard Moore, Alex Kipman e Andrew Blake, Real-time human pose recognition in parts from single depth images, in Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), IEEE, giugno 2011, p. 1297–1304, DOI:10.1109/CVPR.2011.5995316, ISBN 978-1-4577-0394-2.
  49. ^ Microsoft Kinect 'fastest-selling device on record', su bbc.com, 10 marzo 2011. URL consultato il 1º luglio 2026.
  50. ^ Enrico Martini, Harshil Parekh, Shaoting Peng, Nicola Bombieri e Nadia Figueroa, A Robust Filter for Marker-less Multi-person Tracking in Human-Robot Interaction Scenarios, in 2024 33rd IEEE International Conference on Robot and Human Interactive Communication (ROMAN), agosto 2024, p. 424–429, DOI:10.1109/RO-MAN60168.2024.10731365.
  51. ^ Ana Filipa Rodrigues Nogueira, Hélder P. Oliveira e Luís F. Teixeira, Markerless multi-view 3D human pose estimation: A survey, in Image and Vision Computing, vol. 155, 1º marzo 2025, p. 105437, DOI:10.1016/j.imavis.2025.105437, ISSN 0262-8856 (WC · ACNP).
  52. ^ (EN) Yucheng Chen, Yingli Tian e Mingyi He, Monocular human pose estimation: A survey of deep learning-based methods, in Computer Vision and Image Understanding, vol. 192, marzo 2020, p. 102897, DOI:10.1016/j.cviu.2019.102897.
  53. ^ (EN) Federica Bogo, Angjoo Kanazawa, Christoph Lassner, Peter Gehler, Javier Romero e Michael J. Black, Keep it SMPL: Automatic Estimation of 3D Human Pose and Shape from a Single Image, su arXiv.org, 27 luglio 2016, DOI:10.48550/arXiv.1607.08128. URL consultato il 1º luglio 2026.
  54. ^ Dushyant Mehta, Helge Rhodin, Dan Casas, Pascal Fua, Oleksandr Sotnychenko, Weipeng Xu e Christian Theobalt, Monocular 3D Human Pose Estimation in the Wild Using Improved CNN Supervision, in Proceedings of the 5th International Conference on 3D Vision (3DV), IEEE, ottobre 2017, p. 506–516, DOI:10.1109/3DV.2017.00064, ISBN 978-1-5386-2610-8.
  55. ^ (EN) Leonid Sigal, Alexandru O. Balan e Michael J. Black, HumanEva: Synchronized Video and Motion Capture Dataset and Baseline Algorithm for Evaluation of Articulated Human Motion, in International Journal of Computer Vision, vol. 87, n. 1-2, marzo 2010, p. 4–27, DOI:10.1007/s11263-009-0273-6, ISSN 0920-5691 (WC · ACNP).
  56. ^ Nidhi Seethapathi, Shaofei Wang, Rachit Saluja, Gunnar Blohm e Konrad P. Kording, Movement science needs different pose tracking algorithms, arXiv, 24 luglio 2019, DOI:10.48550/arXiv.1907.10226, arXiv:1907.10226. URL consultato il 1º luglio 2026.
  57. ^ Dushyant Mehta, Oleksandr Sotnychenko, Franziska Mueller, Weipeng Xu, Mohamed Elgharib, Pascal Fua, Hans-Peter Seidel, Helge Rhodin, Gerard Pons-Moll e Christian Theobalt, XNect: Real-time Multi-Person 3D Motion Capture with a Single RGB Camera, in ACM Transactions on Graphics, vol. 39, n. 4, 31 agosto 2020, DOI:10.1145/3386569.3392410, ISSN 0730-0301 (WC · ACNP).
  58. ^ (EN) Alice Xiang, Being 'Seen' vs. 'Mis-Seen': Tensions between Privacy and Fairness in Computer Vision, in SSRN Electronic Journal, 2022, DOI:10.2139/ssrn.4068921, ISSN 1556-5068 (WC · ACNP).

Collegamenti esterni

Content Disclaimer

Informasi ini disarikan dari Wikipedia dan disajikan kembali untuk tujuan edukasi. Konten tersedia di bawah lisensi CC BY-SA 3.0. Kami tidak bertanggung jawab atas ketidakakuratan data yang bersumber dari kontribusi publik tersebut.

  1. The information displayed on this website is sourced in part or in whole from Wikipedia and has been adapted for the purpose of restating it. We strive to provide accurate and relevant information, however:
  2. There is no guarantee of absolute accuracy. Wikipedia is an open, collaborative project that can be edited by anyone, so information is subject to change.
  3. It is not intended to constitute professional advice. The content displayed is for informational and educational purposes only. For important decisions (e.g., medical, legal, or financial), please consult a professional.
  4. Content copyright. Wikipedia is licensed under the Creative Commons Attribution-ShareAlike License (CC BY-SA). This means that content may be reused with appropriate attribution and shared under a similar license.
  5. Responsible use. Any risk arising from the use of information from this website is entirely the responsibility of the user.