Apprentissage non-supervisé de la morphologie des langues à l’aide de modèles bayésiens non-paramétriques

Résumé : Un problème central contribuant à la grande difficulté du traitement du langage naturel par des méthodes statistiques est celui de la parcimonie des données, à savoir le fait que dans un corpus d'apprentissage donné, la plupart des évènements linguistiques n'ont qu'un nombre d'occurrences assez faible, et que par ailleurs un nombre infini d'évènements permis par une langue n'apparaitront nulle part dans le corpus. Les modèles neuronaux ont déjà contribué à partiellement résoudre le problème de la parcimonie en inférant des représentations continues de mots. Ces représentations continues permettent de structurer le lexique en induisant une notion de similarité sémantique ou syntaxique entre les mots. Toutefois, les modèles neuronaux actuellement les plus répandus n'offrent qu'une solution partielle au problème de la parcimonie, notamment par le fait que ceux-ci nécessitent une représentation distribuée pour chaque mot du vocabulaire, mais sont incapables d'attribuer une représentation à des mots hors vocabulaire. Ce problème est particulièrement marqué dans des langues morphologiquement riches, ou des processus de formation de mots complexes mènent à une prolifération des formes de mots possibles, et à une faible coïncidence entre le lexique observé lors de l’entrainement d’un modèle, et le lexique observé lors de son déploiement. Aujourd'hui, l'anglais n'est plus la langue majoritairement utilisée sur le Web, et concevoir des systèmes de traduction automatique pouvant appréhender des langues dont la morphologie est très éloignée des langues ouest-européennes est un enjeu important. L’objectif de cette thèse est de développer de nouveaux modèles capables d’inférer de manière non-supervisée les processus de formation de mots sous-jacents au lexique observé, afin de pouvoir de pouvoir produire des analyses morphologiques de nouvelles formes de mots non observées lors de l’entraînement.
Liste complète des métadonnées

Littérature citée [64 références]  Voir  Masquer  Télécharger

https://tel.archives-ouvertes.fr/tel-02354184
Contributeur : Abes Star <>
Soumis le : jeudi 7 novembre 2019 - 15:59:17
Dernière modification le : jeudi 2 janvier 2020 - 14:58:04

Fichier

76238_LOSER_2019_archivage.pdf
Version validée par le jury (STAR)

Identifiants

  • HAL Id : tel-02354184, version 1

Citation

Kevin Löser. Apprentissage non-supervisé de la morphologie des langues à l’aide de modèles bayésiens non-paramétriques. Informatique et langage [cs.CL]. Université Paris-Saclay, 2019. Français. ⟨NNT : 2019SACLS203⟩. ⟨tel-02354184⟩

Partager

Métriques

Consultations de la notice

132

Téléchargements de fichiers

56