Soilahoudine Mohamed Ali

Soilahoudine Mohamed Ali

CEO de Komor-IA · Fondateur & DG de KM-News

Constitution d'un corpus en shikomori : vers une couverture lexicale élargie
IA Tech

Constitution d'un corpus en shikomori : vers une couverture lexicale élargie

Dans le cadre de ses travaux visant à construire l'une des premières grandes bases de données linguistiques en shikomori, Komor-IA avait initialement opté pour une approche centrée sur des sources exclusivement comoriennes, articles de presse, médias en ligne et plateformes d'information locales, rédigés en français, en arabe ou en anglais. L'objectif était de garantir un ancrage lexical et culturel fidèle au champ sémantique comorien, condition essentielle pour l'adaptation de futurs modèles de traitement automatique des langues (TAL/NLP).

Cependant, une analyse approfondie des besoins du corpus a conduit à reconsidérer cette approche. En se limitant aux seules sources comoriennes, le risque d'une couverture lexicale insuffisante devenait significatif.

En linguistique computationnelle, la couverture lexicale désigne le rapport entre le nombre de mots distincts présents dans un corpus et le nombre total de mots que compte le vocabulaire d'une langue. À titre d'illustration, si le shikomori comprend 50 000 formes lexicales distinctes et que le corpus n'en couvre que 30 000, la couverture lexicale atteint 60 %. Un seuil pas souvent suffisant pour entraîner des modèles robustes et généralisables.

Afin d'élargir significativement cette couverture, Komor-IA envisage désormais d'intégrer des sources complémentaires telles que Wikipédia, permettant l'enrichissement du corpus avec entre 200 000 et 500 000 articles supplémentaires.

Cette stratégie d'extension vise à produire un corpus plus représentatif de la diversité lexicale du shikomori, tout en consolidant les bases nécessaires au développement de ressources linguistiques numériques de qualité pour cette langue.