Méthodologie d’harmonisation et de traitement des données orales du CÉFC - HAL Accéder directement au contenu
Article dans une revue Langages Année : 2020

Methodology to harmonize and process the oral data of CEFC

Méthodologie d’harmonisation et de traitement des données orales du CÉFC

Résumé

The CEFC corpus includes data from several different sources to make observable the diversity of oral French at least partly, solving the problems inherent to the heterogeneity of these data is intrinsic to the constitution of this resource and motivated by its objective. This article will describe, step by step, the methodological approach that enables us to build a homogeneous resource by pooling these different sources in order to provide coherent automatic annotations and to facilitate the analysis of an oral corpus of several million words.
Le CÉFC comprend des données de plusieurs sources différentes, ce qui permet d’observer au moins en partie la diversité du français. La résolution des problèmes inhérents à l’hétérogénéité de ces données est donc intrinsèque à la constitution de cette ressource et motivée par son objectif. Cet article décrira étape par étape l’approche méthodologique qui a permis de construire une ressource orale homogène en mutualisant différentes sources afin de procéder à des annotations automatiques cohérentes et de faciliter les analyses d’un corpus oral de plusieurs millions de mots.
Loading...
Fichier non déposé

Dates et versions

halshs-03008795, version 1 (16-11-2020)

Licence

Copyright (Tous droits réservés)

Identifiants

Citer

Christophe Benzitoun, Carole Etienne. Méthodologie d’harmonisation et de traitement des données orales du CÉFC. Langages, 2020, Orféo : un corpus et une plateforme pour l'étude du français contemporain, 219, pp.39-52. ⟨10.3917/lang.219.0039⟩. ⟨halshs-03008795⟩
59 Consultations
0 Téléchargements
Dernière date de mise à jour le 07/04/2024
comment ces indicateurs sont-ils produits

Altmetric

Partager

Gmail Facebook Twitter LinkedIn Plus