Word2vec

Word2vec
Type
Spécialité (d), discipline (d), Word embeddingVoir et modifier les données sur Wikidata

En intelligence artificielle et en apprentissage machine, Word2vec est un groupe de modèles utilisé pour le plongement lexical (word embedding). Ces modèles ont été développés par une équipe de recherche chez Google sous la direction de Tomas Mikolov (en).

Ce sont des réseaux de neurones artificiels à deux couches entraînés pour reconstruire le contexte linguistique des mots. La méthode est implémentée dans la bibliothèque Python Gensim[1].

Architectures

Deux architectures ont été initialement proposées pour apprendre les Word2vec, le modèle de sacs de mots continus (CBOW: continuous bag of words) et le modèle skip-gram[2]. Le CBOW vise à prédire un mot étant donné son contexte, c'est-à-dire étant donné les mots qui en sont proches dans le texte. Un tel contexte est par exemple les 5 mots à droite et les 5 mots à gauche du mot à prédire. Le skip-gram a une architecture symétrique visant à prédire les mots du contexte étant donné un mot en entrée.

les modèles CBOW et Skip-gram de word2vec
les modèles CBOW et Skip-gram de word2vec.

En pratique, le modèle CBOW est plus rapide à apprendre, mais le modèle skip-gram donne généralement de meilleurs résultats[3].

Dans les deux cas, le réseau de neurones comporte deux couches. La couche cachée contient quelques centaines de neurones et constitue, à l'issue de la représentation, le plongement lexical (embedding) permettant de représenter un mot. La couche de sortie permet d'implémenter une tâche de classification au moyen d'une softmax.

L'apprentissage ne nécessite néanmoins aucun label, la vérité étant directement déduite des données et plus particulièrement de la proximité des mots au sein du corpus d'entraînement. En ce sens, l'apprentissage de Word2vec constitue un apprentissage auto-supervisé[4].

Notes et références

  1. (en) « Gensim: topic modelling for humans », sur radimrehurek.com (consulté le )
  2. Tomas Mikolov Tomas, Sutskever, Ilya, Chen, Kai, Corrado, Greg S. et Dean, Jeff, « Efficient Estimation of Word Representations in Vector Space », Arxiv,‎ (arXiv 1301.3781, lire en ligne)
  3. Tomas Mikolov Tomas, Sutskever, Ilya, Chen, Kai, Corrado, Greg S. et Dean, Jeff, « Distributed representations of words and phrases and their compositionality », Advances in Neural Information Processing Systems,‎ (Bibcode 2013arXiv1310.4546M, arXiv 1310.4546)
  4. « Self-supervised learning: The dark matter of intelligence », sur Meta AI, (consulté le )

Bibliographie

Voir aussi

Content Disclaimer

Informasi ini disarikan dari Wikipedia dan disajikan kembali untuk tujuan edukasi. Konten tersedia di bawah lisensi CC BY-SA 3.0. Kami tidak bertanggung jawab atas ketidakakuratan data yang bersumber dari kontribusi publik tersebut.

  1. The information displayed on this website is sourced in part or in whole from Wikipedia and has been adapted for the purpose of restating it. We strive to provide accurate and relevant information, however:
  2. There is no guarantee of absolute accuracy. Wikipedia is an open, collaborative project that can be edited by anyone, so information is subject to change.
  3. It is not intended to constitute professional advice. The content displayed is for informational and educational purposes only. For important decisions (e.g., medical, legal, or financial), please consult a professional.
  4. Content copyright. Wikipedia is licensed under the Creative Commons Attribution-ShareAlike License (CC BY-SA). This means that content may be reused with appropriate attribution and shared under a similar license.
  5. Responsible use. Any risk arising from the use of information from this website is entirely the responsibility of the user.