Extraction automatique de cadres de sous-catégorisation verbale pour le français à partir d'un corpus arboré

Anna Kupść, « Extraction automatique de cadres de sous-catégorisation verbale pour le français à partir d'un corpus arboré », HAL-SHS : linguistique, ID : 10670/1.o9xlgg

Partage / Export

Résumé 0

Nous présentons une expérience d'extraction automatique des cadres de souscatégorisation pour 1362 verbes français. Nous exploitons un corpus journalistique richement annoté de 10 000 phrases dont nous extrayons 12 510 occurrences verbales. Nous évaluons dans un premier temps l'extraction des cadres basée sur la fonction des arguments, ce qui nous fournit 39 cadres différents avec une moyenne de 1.54 cadres par lemme. Ensuite, nous adoptons une approche mixte (fonction et catégorie syntaxique) qui nous fournit dans un premier temps 925 cadres différents, avec une moyenne de 3.44 cadres par lemme. Plusieurs méthodes de factorisation, neutralisant en particulier les variantes de réalisation avec le passif ou les pronoms clitiques, sont ensuite appliquées et nous permettent d'aboutir à 235 cadres différents avec une moyenne de 1.94 cadres par verbe. Nous comparons brièvement nos résultats avec les travaux existants pour le français et pour l'anglais.

Extraction automatique de cadres de sous-catégorisation verbale pour le français à partir d'un corpus arboré

Fiche du document

Mots-clés Ro

Sujets proches En Fr

Citer ce document

Métriques

Partage / Export

Résumé 0

Par les mêmes auteurs

Sur les mêmes sujets

Sur les mêmes disciplines

Exporter en