Dans le cadre de l’enquête du projet ALUMCoCo, chaque répondant devait choisir quel sens était présent dans une dizaine de courts extraits textuels parmi un ensemble de 2 à 4 sens qui lui été présentés.
Chaque sens était susceptible d’être associé à 20 extraits et chaque extrait a ainsi été annoté par 32,38 personnes différentes en moyenne ( de 21 à 52 répondants par extrait).
Quel que soit le nombre de sens présentés, seuls environ 1/4 des contextes ne se sont vus attribuer qu’un seul sens :
On s’attendait à ce que la confusion entre sens sémantiquement proches soit plus grande qu’entre sens éloignés. Ainsi, dans un contexte dans lequel apparaissait cigarette, les cas de désaccords entre répondants devaient concerner davantage les sens cigarette#1[Petit cylindre de tabac finement haché entouré d’une feuille de papier fin, que l’on fume] et cigarette#2[Consommation de cigarettes] que les sens cigarette#1[Petit cylindre de tabac finement haché entouré d’une feuille de papier fin, que l’on fume] et cigarette#3[Forme qui rappelle celle d’une cigarette.].
Pour faire un premier pas vers la vérification de cette hypothèse, j’ai construit deux matrices de confusion. La première, sans pondération, donne le nombre de contextes dans lesquels deux sens distincts sont présents. Le diagramme ci-dessous permet de visualiser le contenu de cette matrice :
On y voit que, comme attendu, le nombre de contextes pour lesquels certains répondants ont choisi cigarette#1 tandis que d’autres ont choisi cigarette#2 est plus élevé (10 contextes) que le nombre de contextes pour lequel la confusion a eu lieu entre cigarette#1 et cigarette#3 (3 contextes).
Dans la seconde, dite pondérée, pour chaque couple de sens (i,j), j’ai fait la somme du nombre de répondants choisissant le sens i multiplié par le nombre de répondants choisissant le sens j par contexte :
Ici, si dans trois contextes, trois fois de suite, 1 répondant a choisi le sens i et 9 ont choisi le sens j, la confusion est considérée comme étant plus faible (1*9 + 1*9 + 1*9 = 27) que si, dans ces mêmes trois contextes, 5 répondants avaient choisi le sens i et 5 avaient choisi le sens j (5*5 + 5*5 + 5*5 = 75). Le nombre de répondants par contexte n’est cependant pas pris en compte.
Ces outils de visualisation, parmi d’autres, permettent de multiplier les points de vue sur les données avant d’attaquer l’analyse qualitative à proprement parler.



