Calcul de similarité entre phrases : quelles mesures et quels descripteurs ?



Calcul de similarité entre phrases : quelles mesures et quels descripteurs ?
Davide Buscaldi, Ghazi Felhi, Dhaou Ghoul, Joseph Le Roux, Gaël Lejeune and Xudong Zhang
Cet article présente notre participation à l’édition 2020 du Défi Fouille de Textes DEFT et plus exactement aux deux tâches ayant trait à la similarité entre phrases. Dans notre travail nous nous sommes intéressé à deux questions: celle du choix de la mesure du similarité d’une part et celle du choix des opérandes sur lesquelles se porte la mesure de similarité.
Nous avons notamment étudié la question de savoir s’il fallait utiliser des mots ou des chaînes de caractères (mots ou non-mots). Nous montrons d’une part que la similarité de bray-curtis est significativement plus efficace que la similarité cosinus et d’autre part que le calcul de similarité sur des chaînes de caractères est plus efficace que le même calcul sur des mots.



Similarité sémantique entre phrases : apprentissage par transfert interlingue



Similarité sémantique entre phrases : apprentissage par transfert interlingue
Charles Teissèdre, Thiziri Belkacem and Maxime Arens
Dans cet article, nous décrivons une approche exploratoire pour entraîner des modèles de langue et résoudre des tâches d’appariement entre phrases issues de corpus en français et relevant du domaine médical. Nous montrons que, dans un contexte où les données d’entraînement sont en nombre restreint, il peut être intéressant d’opérer un apprentissage par transfert, d’une langue dont nous disposons de plus de ressources pour l’entraînement, vers une langue cible moins dotée de données d’entraînement (le français dans notre cas). Les résultats de nos expérimentations montrent que les modèles de langue multilingues sont capables de transférer des représentations d’une langue à l’autre de façon efficace pour résoudre des tâches de similarité sémantique telles que celles proposées dans le cadre de l’édition 2020 du Défi fouille de texte (DEFT).
Text mining challenge: semantic similarity and fine information extraction. In this paper, we describe an exploratory approach to train language models and solve sentence-matching tasks from French corpora in the medical field. We show that, in a context where training data are limited, it may be interesting to transfer learning from a language with more training resources to a target language with less training data (French in our case). The results of our experiments show that multilingual language models are able to transfer representations from one language to another efficiently to solve semantic similarity, tasks such as those proposed in the 2020 edition of the Text Mining Challenge (DEFT).


Réseaux de neurones pour la résolution d’analogies entre phrases en traduction automatique par l’exemple

Réseaux de neurones pour la résolution d’analogies entre phrases en traduction automatique par l’exemple
Valentin Taillandier, Liyan Wang and Yves Lepage
Cet article propose un modèle de réseau de neurones pour la résolution d’équations analogiques au niveau sémantique et entre phrases dans le cadre de la traduction automatique par l’exemple. Son originalité réside dans le fait qu’il fusionne les deux approches, directe et indirecte, de la traduction par l’exemple.

Représentation sémantique des familles dérivationnelles au moyen de frames morphosémantiques

Représentation sémantique des familles dérivationnelles au moyen de frames morphosémantiques
Daniele Sanacore, Nabil Hathout and Fiammetta Namer
L’article présente un nouveau formalisme de représentation des relations morphologiques dérivation-nelles inspiré de la sémantique des frames. Dans ce formalisme, la description morphosémantiqueest réalisée au niveau de la famille dérivationnelle au moyen de frames morphosémantiques danslesquels les lexèmes sont interdéfinis les uns relativement aux autres. Les frames morphosémantiquespermettent par ailleurs de rendre compte de la structure paradigmatique par l’alignement des sériesde lexèmes qui se trouvent dans les mêmes oppositions de sens. La seconde partie de l’article estconsacrée au type de données, notamment lexicographiques, qui pourraient être utilisées pour produireautomatiquement ces représentations.

FlauBERT : des modèles de langue contextualisés pré-entraînés pour le français



FlauBERT : des modèles de langue contextualisés pré-entraînés pour le français
Hang Le, Loïc Vial, Jibril Frej, Vincent Segonne, Maximin Coavoux, Benjamin Lecouteux, Alexandre Allauzen, Benoît Crabbé, Laurent Besacier et Didier Schwab
Les modèles de langue pré-entraînés sont désormais indispensables pour obtenir des résultats à l’état-de-l’art dans de nombreuses tâches du TALN. Tirant avantage de l’énorme quantité de textes bruts disponibles, ils permettent d’extraire des représentations continues des mots, contextualisées au niveau de la phrase. L’efficacité de ces représentations pour résoudre plusieurs tâches de TALN a été démontrée récemment pour l’anglais. Dans cet article, nous présentons et partageons FlauBERT, un ensemble de modèles appris sur un corpus français hétérogène et de taille importante. Des modèles de complexité différente sont entraînés à l’aide du nouveau supercalculateur Jean Zay du CNRS. Nous évaluons nos modèles de langue sur diverses tâches en français (classification de textes, paraphrase, inférence en langage naturel, analyse syntaxique, désambiguïsation automatique) et montrons qu’ils surpassent souvent les autres approches sur le référentiel d’évaluation FLUE également présenté ici.



Sur l’impact des contraintes structurelles pour l’analyse en dépendances profondes fondée sur les graphes

Sur l’impact des contraintes structurelles pour l’analyse en dépendances profondes fondée sur les graphes
Caio Corro
Les algorithmes existants pour l’analyse en dépendances profondes fondée sur des graphes capables de garantir la connexité des structures produites ne couvrent pas les corpus du français.
Nous proposons un nouvel algorithme qui couvre l’ensemble des structures possibles.
Nous nous évaluons sur les corpus français FTB et Sequoia et observons un compromis entre la production de structures valides et la qualité des analyses.

Classification de relations pour l’intelligence économique et concurrentielle

Classification de relations pour l’intelligence économique et concurrentielle
Hadjer Khaldi, Amine Abdaoui, Farah Benamara, Grégoire Sigel and Nathalie Aussenac-Gilles
L’extraction de relations est une tâche d’extraction d’information qui permet de détecter les liens sémantiques reliant des entités. Cette tâche a fait l’objet de nombreux travaux visant à extraire des relations génériques comme l’hyperonymie ou spécifiques comme des relations entre gènes et protéines. Dans cet article, nous nous intéressons aux relations économiques entre deux entités nommées de type organisation à partir de textes issus du web. Ce type de relation, encore peu étudié dans la littérature, a pour but l’identification des liens entre les acteurs d’un secteur d’activité afin d’analyser leurs écosystèmes économiques.
Nous présentons BizRel, le premier corpus français annoté en relations économiques ainsi qu’une approche supervisée à base de différentes architectures neuronales pour la classification de ces relations. L’évaluation de ces modèles montre des résultats très encourageants, ce qui est un premier pas vers l’intelligence économique et concurrentielle à partir de textes pour le français.