info:eu-repo/semantics/OpenAccess
Adèle Désoyer et al., « Les coréférences à l'oral : une expérience d'apprentissage automatique sur le corpus ANCOR », HAL-SHS : sciences de l'information, de la communication et des bibliothèques, ID : 10670/1.esujbk
Cet article présente CROC (Coreference Resolution for Oral Corpus), le premier sys-tème de résolution des coréférences en français reposant sur des techniques d'apprentissage automatique. Une des spécificités du système réside dans son apprentissage sur des données exclusivement orales, à savoir ANCOR (anaphore et coréférence dans les corpus oraux), le premier corpus de français oral transcrit annoté en relations anaphoriques. En l'état actuel, le système CROC nécessite un repérage préalable des mentions. Nous détaillons les choix des traits – issus du corpus ou calculés – utilisés par l'apprentissage, et nous présentons un ensemble d'expérimentations avec ces traits. Les scores obtenus sont très proches de ceux de l'état de l'art des systèmes conçus pour l'écrit. Nous concluons alors en donnant des perspectives sur la réalisation d'un système end-to-end valable à la fois pour l'oral transcrit et l'écrit.