close
Aller au contenu

Bigramme

Un article de Wikipédia, l'encyclopédie libre.

Un bigramme est un cas particulier de n‑gramme : c'est une séquence de deux éléments adjacents, généralement deux mots consécutifs dans un texte.

En linguistique informatique

[modifier | modifier le code]

En linguistique computationnelle, les modèles de n‑grammes (dont les bigrammes), sont largement utilisés pour analyser les fréquences de séquences et mettre en évidence des motifs récurrents, comme des préférences lexicales, des formules figées ou des tics de langage ; ces méthodes peuvent contribuer à identifier des formes de répétition cyclique que l’on peut décrire, dans une perspective plus interprétative, comme des « boucles textuelles » (Une boucle textuelle est un motif de texte (mot, groupe de mots, syntagme, fragment de phrase, titre, slogan) qui se répète de manière cyclique dans un discours ou un corpus, souvent avec une forme identique ou très proche. Cette répétition peut être intra‑texte (au sein d’un même texte : refrain, anaphore, leitmotiv, reprise d’un même segment) ; ou inter‑texte (à travers différents textes : recyclage de titres, de slogans, de formules fixées, etc.).

Dans le domaine de l'intelligence artificielle

[modifier | modifier le code]

Un modèle de langage bigramme est un modèle statistique qui prédit chaque mot d’une séquence uniquement à partir du mot qui le précède, en appliquant l’hypothèse de Markov pour simplifier les dépendances linguistiques.

Il calcule ainsi des probabilités conditionnelles sur des paires de mots consécutifs, ce qui en fait un outil simple mais limité, capturant seulement des dépendances locales. Malgré ces limites, il a été une base historique importante pour des applications comme la génération de texte, la reconnaissance vocale ou la traduction automatique, et il a servi de base à des modèles plus avancés tels que les trigrammes et les réseaux neuronaux modernes[1].

Dans le domaine des jeux

[modifier | modifier le code]

Un bigramme est un jeu de lettres qui consiste à construire deux mots avec les lettres d'un seul mot et en utilisant la totalité des lettres disponibles, une seule fois chacune. En cela, il est également un N-gramme de rang 2.

Copie d'écran du jeu
Jeu de bigramme.
  • ARRIMEUR permet de créer ERRA (errer, passé simple) et MURI (murir, participe passé). On ne tient pas compte des accents. 12 couples de mots sont solutions de ce bigramme.
  • CORNÉLIENNES (adjectif) permet de créer CERNÉE (cerner, participe passé) et LINONS (toile de lin). 39 couples de mots sont solutions de ce bigramme.

Applications

[modifier | modifier le code]

Les bigrammes, ainsi que d'autres n-grammes, sont utilisés dans la plupart des modèles de langage efficaces pour la reconnaissance vocale[2]. Certaines activités de logologie ou de linguistique récréative impliquent des bigrammes. Il s'agit notamment de tentatives de recherche de mots anglais commençant par chaque bigramme possible[3], ou de mots contenant une chaîne de bigrammes répétés, tels que logogogue[4].

Références

[modifier | modifier le code]
  1. (en) « What is a bigram language model? », sur educative.io (consulté le ).
  2. (en) Michael John Collins, Proceedings of the 34th annual meeting on Association for Computational Linguistics, Association for Computational Linguistics, , 184–191 p. (DOI 10.3115/981863.981888, arXiv cmp-lg/9605012, S2CID 12615602), « A new statistical parser based on bigram lexical dependencies ».
  3. (en) Philip M. Cohen, « Initial Bigrams », Word Ways, vol. 8, no 2, (lire en ligne, consulté le ).
  4. (en) Kyle Corbin, « Double, Triple, and Quadruple Bigrams », Word Ways, vol. 22, no 3, (lire en ligne, consulté le ).