Technologie

Les chercheurs utilisent Reddit pour étudier le cannabis et la douleur

mm
Ajouter MyCannabis.com à vos sources préférées sur Google

Lorsqu’on parle de cannabis et de soulagement de la douleur, la conversation porte souvent sur les essais cliniques, les enquêtes auprès des patients ou les témoignages personnels. Mais que pourraient apprendre les chercheurs des milliers de conversations réelles qui ont déjà lieu en ligne ?

Une étude de 20261 publiée dans Data in Brief adopte une approche originale pour comprendre les discussions liées au cannabis. Au lieu de vérifier si le cannabis réduit la douleur, les chercheurs ont créé un jeu de données spécialisé à partir de publications publiques sur Reddit afin d’entraîner des outils d’intelligence artificielle capables de mieux analyser la manière dont les gens parlent du cannabis dans le contexte de la prise en charge de la douleur.

Le projet ne détermine pas si le cannabis soulage la douleur. Il fournit plutôt une ressource de recherche précieuse qui pourrait aider les scientifiques à mieux comprendre l’expérience des patients, à repérer les tendances émergentes et à améliorer l’analyse des discussions en ligne relatives à la santé.

Pourquoi les discussions en ligne sur le cannabis sont importantes

Des millions de personnes utilisent les réseaux sociaux pour partager leur expérience en matière de santé. Reddit, en particulier, est devenu un lieu apprécié pour discuter de douleur chronique, de maladies auto-immunes, de médicaments et de solutions thérapeutiques alternatives. Ces conversations peuvent donner aux chercheurs un aperçu du point de vue des patients, qui n’apparaît pas toujours dans les études médicales traditionnelles. Les personnes parlent souvent de leurs symptômes, de leurs décisions thérapeutiques, des effets secondaires et de leur vécu avec leurs propres mots.

L’analyse de grands volumes de conversations en ligne reste toutefois difficile. Les chercheurs humains ne peuvent examiner qu’un nombre limité de publications ; c’est pourquoi l’intelligence artificielle et les systèmes d’apprentissage automatique servent de plus en plus à traiter les données de santé. Pour interpréter correctement ces conversations, les systèmes d’IA ont besoin de données d’entraînement de qualité. C’est précisément l’objet de ce jeu de données Reddit sur le cannabis.

Création d’un jeu de données Reddit sur le cannabis

L’équipe de recherche a constitué un jeu de données annoté manuellement, centré sur les discussions liées au cannabis au sein de communautés Reddit consacrées aux maladies rhumatismales auto-immunes. Pour le créer, les chercheurs ont interrogé des publications accessibles au public à l’aide d’un ensemble structuré de termes liés au cannabis. Après avoir repéré les discussions pertinentes, ils ont extrait des segments précis et les ont soigneusement examinés. Le jeu final comprend 479 paires publication-aspect, c’est-à-dire des extraits de texte associés à des sujets ou aspects précis concernant le cannabis.

Ce jeu de données est particulièrement utile parce qu’il a été annoté manuellement par des évaluateurs humains, et non uniquement par des outils automatisés. L’annotation humaine fournit une référence à partir de laquelle les futurs systèmes d’IA pourront apprendre et être évalués.

Les chercheurs ont ensuite classé le contenu selon le sentiment exprimé, afin que de futurs modèles d’apprentissage automatique puissent apprendre comment les internautes formulent des opinions positives, négatives ou neutres sur leurs expériences liées au cannabis.

Chaîne de traitement des données : de la publication Reddit aux données d’entraînement de l’IA

La méthode systématique utilisée par les chercheurs pour constituer les 479 paires publication-aspect finales.

Étape Action technique Résultat / objectif
1Collecte des données Extraction ciblée de sous-forums Reddit publics exclusivement consacrés aux maladies rhumatismales auto-immunes. Discussions brutes de communautés de patients
2Filtrage par mots-clés Recherche dans les publications brutes à l’aide d’un dictionnaire sélectionné de termes, variantes et expressions familières liés au cannabis. Sous-ensembles de textes propres au cannabis
3Segmentation Application d’une segmentation des phrases fondée sur des règles afin d’isoler les phrases contenant un contexte précis, plutôt que d’analyser des textes entiers de plusieurs paragraphes. Segments contextuels isolés
4Double annotation Des experts humains ont étiqueté manuellement chaque segment selon deux niveaux distincts :
  • Sentiment traditionnel : tonalité générale.
  • Sentiment par aspect : caractéristiques précises visées (par exemple, effets secondaires ou efficacité).
479 paires publication-aspect vérifiées
(classées comme positives, négatives ou neutres)

Qu’est-ce que l’analyse des sentiments par aspect ?

L’un des aspects les plus intéressants du projet est l’attention portée à ce que l’on appelle l’analyse des sentiments par aspect. L’analyse traditionnelle des sentiments étudie la tonalité générale d’un énoncé. Une publication peut, par exemple, être classée comme globalement positive, négative ou neutre. L’analyse des sentiments par aspect va plus loin : au lieu d’évaluer une publication entière comme une seule unité, elle repère des sujets précis dans la discussion et détermine ce que l’auteur ressent à propos de chacun.

Imaginons qu’une personne écrive que le cannabis l’a aidée à mieux dormir, mais lui a causé des effets secondaires indésirables. Un système traditionnel pourrait avoir du mal à classer cette publication, car elle contient des avis positifs et négatifs. L’analyse par aspect peut séparer ces points de vue et reconnaître que la personne exprime un sentiment positif à propos de l’amélioration du sommeil, mais négatif à propos des effets secondaires. Cette approche plus détaillée peut aider les chercheurs à mieux comprendre la complexité des conversations sur la santé.

Ce que les chercheurs ont découvert

L’objectif principal de l’étude n’était pas d’évaluer le cannabis comme traitement, mais de créer un jeu de données fiable pour de futures recherches. Pour mesurer la qualité de leurs annotations, les chercheurs ont évalué l’accord entre les examinateurs à l’aide d’une méthode statistique appelée alpha de Krippendorff. Celle-ci indique dans quelle mesure différentes personnes interprètent le même contenu de façon cohérente.

Les résultats ont montré un accord modéré entre les annotateurs, tant pour l’analyse traditionnelle que pour l’analyse par aspect. Cela laisse penser que le jeu de données constitue une base utile pour le développement futur de l’apprentissage automatique. Surtout, le projet a démontré que les discussions liées au cannabis peuvent être repérées, organisées et étiquetées de manière systématique afin de soutenir des recherches avancées en traitement automatique du langage.

Le jeu de données est désormais accessible au public. D’autres chercheurs peuvent ainsi l’utiliser pour entraîner, étalonner et évaluer des modèles d’IA destinés à analyser les discussions de santé sur les réseaux sociaux.

Pourquoi ce jeu de données est important

À première vue, un article consacré à un jeu de données peut sembler moins passionnant qu’un essai clinique. Pourtant, ce type de ressource joue souvent un rôle essentiel dans les progrès de la recherche scientifique. La qualité d’un système d’intelligence artificielle dépend des données utilisées pour l’entraîner. Sans jeux de données soigneusement constitués, les chercheurs risquent de concevoir des modèles qui comprennent mal l’expérience des patients ou ne repèrent pas des tendances importantes dans les discussions de santé.

Ce jeu de données pourrait améliorer de futurs outils utilisés dans les domaines suivants :

  • Informatique de santé publique
  • Épidémiologie numérique
  • Recherche médicale
  • Traitement automatique du langage
  • Veille sanitaire sur les réseaux sociaux

À mesure que l’IA s’intègre à la recherche en santé, des jeux de données de qualité peuvent aider les scientifiques à mieux analyser de vastes ensembles de conversations de patients, tout en réduisant le volume d’examen manuel nécessaire.

Ce que cette étude ne démontre pas

Comme la recherche sur le cannabis attire souvent une forte attention du public, il est important de comprendre ce que cette étude devait accomplir — et ce qu’elle ne devait pas accomplir.

Le jeu de données ne démontre pas que le cannabis réduit la douleur. Il ne prouve pas que le cannabis est efficace contre les maladies auto-immunes, l’arthrite, les affections rhumatismales ou toute autre maladie. Il n’évalue pas non plus les résultats thérapeutiques, ne compare pas les produits à base de cannabis, et ne mesure pas l’amélioration des symptômes. L’étude porte exclusivement sur la création d’un ensemble structuré de publications Reddit annotées que de futurs chercheurs pourront utiliser pour concevoir et tester des systèmes d’IA. Le projet vise à comprendre le langage et les discussions des patients, et non à évaluer une efficacité médicale.

L’avenir de l’IA et de la recherche sur le cannabis

Alors que les conversations sur la santé se déroulent de plus en plus en ligne, les chercheurs cherchent de nouvelles façons d’exploiter les expériences que les internautes partagent volontairement sur les plateformes numériques. Ce type de projet montre comment l’intelligence artificielle et la recherche en santé publique commencent à se rejoindre. Loin de remplacer les études cliniques traditionnelles, ces outils pourraient un jour les compléter en aidant à repérer les tendances, les préoccupations et les sujets émergents qui méritent une étude approfondie.

La véritable valeur de ce jeu de données réside dans sa capacité à soutenir de futures découvertes. Fournir aux chercheurs une ressource fiable pour entraîner et évaluer des modèles d’apprentissage automatique contribue à jeter les bases d’analyses plus poussées des expériences rapportées par les patients.

L’étude ne nous dit pas si le cannabis soulage la douleur, mais elle révèle quelque chose de tout aussi important : comprendre comment les gens parlent du cannabis peut constituer une étape essentielle pour comprendre comment ils le vivent. À mesure que les outils d’IA se perfectionnent, de tels jeux de données pourraient aider les chercheurs à transformer de vastes volumes de conversations en ligne en connaissances scientifiques utiles, une publication à la fois.

Références :

1. Tricia Park, Sahithi Lakamana, Aishwarya Alagappan, Catherine Diop, Ege Gursel, Yuting Guo, Titilola Falasinnu, Abeed Sarker, Selen Bozkurt, A Cannabis Use Reddit Dataset for Aspect-Based Sentiment Analysis, Data in Brief, 2026, 112907, ISSN 2352-3409, https://doi.org/10.1016/j.dib.2026.112907

Sarah Schwefel est une journaliste, une analyste de recherche, une conférencière et une défenseure des patients. Après avoir déménagé pour accéder au cannabis pour sa propre santé, elle s'est immergée dans l'industrie du cannabis et du chanvre, déterminée à mieux s'aider elle-même et les autres patients. En 2020, elle est devenue certifiée en études de médecine endocannabinoïde de l'American Journal of Endocannabinoid Medicine. Sarah utilise son expertise pour éduquer et défendre à travers ses écrits sur divers sujets, notamment la législation et les avantages de la médecine végétale.