Un grand corpus oral « disponible » : le corpus d'Orléans 1 1968-2012

Résumé : Cet article présente la constitution et la mise à disposition du corpus oral ESLO. Notre objectif est de montrer qu'il ne s'agit pas seulement de recueillir et rendre disponible des données langagières mais aussi de rendre explicite l'ensemble de la chaîne de traitement qui permet d'élaborer un tel corpus. Après avoir présenté le projet et le corpus nous préciserons les problèmes juridiques et méthodologiques qui ont conditionné les opérations de traitement du corpus et notamment les procédures d'anonymisation indispensables à la libre diffusion de cette ressource. Dans une seconde partie, nous présenterons les différentes annotations effectuées sur les données brutes avec quelques exemples de leurs exploitations. Nous expliquerons la méthodologie suivie qui est toujours guidée par la nature des données et l'objectif final visé : constituer un grand corpus oral variationniste du français. Nous aborderons enfin les questions de mise à disposition du corpus en ligne.
Mots-clés : corpus oral TAL
Document type :
Journal articles
Complete list of metadatas

Cited literature [27 references]  Display  Hide  Download

https://halshs.archives-ouvertes.fr/halshs-01163053
Contributor : Olivier Baude <>
Submitted on : Thursday, June 11, 2015 - 11:37:52 PM
Last modification on : Saturday, June 8, 2019 - 1:27:22 AM
Long-term archiving on : Tuesday, April 25, 2017 - 7:12:41 AM

File

2011_ESLO_TAL52-3.pdf
Files produced by the author(s)

Identifiers

  • HAL Id : halshs-01163053, version 1

Citation

Iris Eshkol-Taravella, Olivier Baude, Denis Maurel, Linda Hriba, Céline Dugua, et al.. Un grand corpus oral « disponible » : le corpus d'Orléans 1 1968-2012. Traitement Automatique des Langues, ATALA, 2011, Ressources Linguistiques Libres, 53 (2), pp.17-46. ⟨halshs-01163053⟩

Share

Metrics

Record views

624

Files downloads

582