Méthodologie d’harmonisation et de traitement des données orales du CÉFC

Fiche du document

Date

2020

Discipline
Type de document
Périmètre
Langue
Identifiant
Source

Langages

Collection

Cairn.info

Organisation

Cairn

Licence

Cairn




Citer ce document

Christophe Benzitoun et al., « Méthodologie d’harmonisation et de traitement des données orales du CÉFC », Langages, ID : 10670/1.x4r4bq


Métriques


Partage / Export

Résumé Fr En

Le céfc comprend des données de plusieurs sources différentes, ce qui permet d’observer au moins en partie la diversité du français. La résolution des problèmes inhérents à l’hétérogénéité de ces données est donc intrinsèque à la constitution de cette ressource et motivée par son objectif. Cet article décrira, étape par étape, l’approche méthodologique qui a permis de construire une ressource orale homogène en mutualisant différentes sources afin de procéder à des annotations automatiques cohérentes et de faciliter les analyses d’un corpus oral de plusieurs millions de mots.

The céfc corpus includes data from several different sources to make observable the diversity of oral French at least partly, solving the problems inherent to the heterogeneity of these data is intrinsic to the constitution of this resource and motivated by its objective. This article will describe, step by step, the methodological approach that enables us to build a homogeneous resource by pooling these different sources in order to provide coherent automatic annotations and to facilitate the analysis of an oral corpus of several million words.

document thumbnail

Par les mêmes auteurs

Sur les mêmes sujets

Sur les mêmes disciplines

Exporter en