Aller au contenu principal
Dictée en ligne.com
ConnexionFaire une dictée

Atlas · 137 824 entrées auditées

Pourquoi l’orthographe française est-elle si difficile ?

L’orthographe française est difficile à produire parce qu’un même son peut s’écrire de plusieurs façons et que de nombreuses lettres ne se prononcent pas. Dans notre corpus de 4 098 formes courantes et non ambiguës, 48,8 % contiennent au moins un graphème muet. La longueur explique presque zéro variation de l’indice structurel : ρ = 0,04.

Par l’équipe pédagogique Dictée en ligne18 min

Réponse courte

L’orthographe française est difficile à produire parce qu’un même son peut s’écrire de plusieurs façons et que de nombreuses lettres ne se prononcent pas. Dans notre corpus de 4 098 formes courantes et non ambiguës, 48,8 % contiennent au moins un graphème muet. La longueur explique presque zéro variation de l’indice structurel : ρ = 0,04.

Les résultats essentiels

Forme en têteœufs

Indice d’irrégularité structurelle : 99,6.

Graphèmes muets48,8 %

1 998 formes sur 4 098.

Son le plus variable/ɛ/

18 graphies attestées dans Lexique-Infra.

Longueurρ = 0,04

Relation de rang presque nulle avec l’indice.

Quels sont les mots français courants les plus difficiles à écrire ?

Les cinq premières formes sont œufs, champs, chœur, camps et goûts. Leur difficulté vient d’un petit nombre de sons associés à plusieurs lettres, souvent complétés par une marque finale non prononcée.

Les dix premières formes du classement. La fréquence est exprimée par million de mots dans le corpus de livres de Lexique 3.83.
RangFormeFréquenceConsistance son → graphieIrrégularitésIndice
1œufs29,800,032 sur 299,6
2champs52,970,342 sur 398,1
3chœur24,860,352 sur 398,0
4camps21,620,212 sur 397,6
5goûts17,030,312 sur 397,2
6attends62,570,303 sur 497,0
7nœud14,460,342 sur 397,0
8vœux10,680,342 sur 397,0
9cents80,540,213 sur 396,9
10laissent22,300,393 sur 496,8

La fréquence n’annule pas l’irrégularité. Temps est extrêmement courant, mais sa forme écrite contient plus d’information que sa prononciation isolée. À l’inverse, un mot long peut être régulier si chaque son appelle une graphie très probable.

Pourquoi « œufs » arrive-t-il en tête ?

Œufs arrive en tête parce qu’il concentre cinq lettres dans seulement deux graphèmes selon la segmentation de Lexique-Infra. Sa consistance phonème-graphème moyenne pondérée par les occurrences n’est que de 0,03 et les deux associations sont classées comme irrégulières.

Le résultat ne signifie pas que œufs provoque toujours plus de fautes que champs ou temps. Il signifie que sa forme est peu déductible à partir de la chaîne sonore dans le système statistique décrit par Lexique-Infra.

La ligature est affichée ici sous la forme typographique œ. La base encode certaines formes avec les deux caractères oe ; cette normalisation d’affichage ne change aucun calcul.

Les reconnaître ne suffit pas : saurez-vous les écrire ? Le test d’orthographe repère vos erreurs récurrentes et vous oriente vers les bonnes règles.

Tester mon orthographe

Quels sons français ont le plus d’orthographes possibles ?

Le son /ɛ/, comme dans paire, est le plus variable de notre analyse pratique : 18 graphies sont attestées et 10 représentent chacune au moins 0,5 % des occurrences. Le son /e/, comme dans été, et la voyelle nasale /ɛ̃/, comme dans cinq, suivent avec sept graphies au-dessus de ce seuil.

Nombre de graphies attestées et principales graphies pondérées par leurs occurrences dans Lexique-Infra.
SonGraphies attestéesGraphies ≥ 0,5 %Graphies les plus fréquentes
/ɛ/1810e 36,61 % ; ai 24,49 % ; ais 11,40 % ; ait 8,81 % ; è 8,30 % ; ê 5,51 %
/e/157é 35,94 % ; e 29,94 % ; er 13,13 % ; ez 10,34 % ; et 8,30 %
/ɛ̃/137en 44,44 % ; in 26,96 % ; ain 16,80 % ; im 5,99 % ; ein 4,31 %
/œ/106eu 88,79 % ; oeu 5,33 % ; u 2,14 % ; e 1,55 %
/s/106s 56,31 % ; c 22,03 % ; ss 10,69 % ; ç 7,31 % ; t 2,94 %
/j/106i 86,08 % ; ill 4,66 % ; ll 3,25 % ; y 2,78 % ; il 1,80 %

Une graphie très rare peut être limitée à une position ou à quelques mots ; le tableau distingue donc toutes les graphies attestées de celles dépassant 0,5 %. Les proportions sont calculées sur les occurrences de Lexique-Infra, pas sur une expérience de dictée.

Le son /ɛ/ possède 18 graphies attestées, dont e, ai, ais, ait, è et ê parmi les plus fréquentes.
Les principales graphies de six sons, pondérées par leurs occurrences. Les graphies sous 0,5 % sont regroupées dans « autres ».

L’asymétrie est centrale : lire part de la graphie pour retrouver le son, tandis qu’écrire sous dictée part du son pour sélectionner une graphie. Les travaux sur des élèves français montrent que la consistance phonème-graphème et la fréquence des mots ont chacune un effet propre sur la réussite orthographique (Lété, Peereman et Fayol, 2008).

Quelles lettres muettes sont les plus fréquentes ?

Le e muet domine largement : il apparaît comme graphème sans réalisation phonologique dans 977 des 4 098 formes du corpus, dont 967 fois en position finale. Viennent ensuite les graphèmes es, s, h, t, ts, ent et x.

Graphèmes muets dans le corpus de 4 098 formes courantes non ambiguës.
Graphème muetFormes concernéesDont en position finaleExemples
e977967abandonne, abattre, absence, absolue, accepte
es296296actes, ailes, aimes, algues, allumettes
s262262accès, acteurs, activités, ailleurs, airs
h980bonheur, cahier, envahit, habile
t9595achat, affût, aperçoit, apparaît, appartient
ts8080agents, amants, appartements, arts, avocats
ent6767aiment, appellent, arrivent, arrivèrent
x6262adieux, barreaux, bateaux, beaux, bijoux

Au total, 48,8 % des formes sélectionnées contiennent au moins un graphème muet. Ce chiffre n’est pas directement comparable à l’estimation d’environ 30 % de mots du lexique terminés par une lettre muette rapportée par Mussar, Sénéchal et Rey : notre filtre vise des formes fréquentes de quatre lettres ou plus et compte tout graphème muet, pas seulement une lettre finale (étude de 2020).

Le e muet apparaît dans 977 formes du corpus, très majoritairement en position finale.
Nombre de formes contenant chacun des huit graphèmes muets les plus présents ; la nuance claire indique la part non finale.

Les lettres muettes ne sont pas toujours arbitraires. Certaines préservent une information morphologique : le t de chant réapparaît dans chanteur. Les connaissances morphologiques aident les enfants à construire ces représentations, même lorsque la consonne ne s’entend pas dans le mot isolé.

Les mots longs sont-ils forcément plus difficiles à écrire ?

Non : dans les 4 098 formes courantes du corpus, la corrélation de rang entre le nombre de lettres et l’indice structurel n’est que de 0,04. La longueur explique donc presque zéro variation de rang.

Indice médian par longueur de forme dans le corpus.
LongueurNombre de formesIndice médian
4 lettres29355,3
5 lettres52351,9
6 lettres78549,1
7 lettres82747,9
8 lettres65950,9
9 lettres45652,8
10 lettres28550,9
11 lettres14253,5
12 lettres7248,0

Un mot court comme eaux ou vingt peut être très difficile à reconstruire depuis le son. Un mot plus long peut multiplier des associations régulières et rester relativement prévisible. La longueur peut néanmoins peser sur la mémoire, la copie ou la probabilité d’une faute dans une tâche réelle ; notre résultat porte uniquement sur l’irrégularité du système.

La longueur des mots et l’indice d’irrégularité ont une corrélation presque nulle ; les médianes par longueur restent proches.
Médiane de l’indice par longueur. Cette vue agrégée ne remplace pas les 4 098 observations utilisées pour calculer ρ = 0,04.

Pourquoi les verbes occupent-ils presque la moitié du top 100 ?

Les verbes représentent 47 des 100 premières formes, contre 43 noms. Cette concentration vient des terminaisons qui ajoutent des lettres ou groupes de lettres peu ou pas audibles : aiment, laissent, appellent, commençaient, allaient, attendent.

Le français écrit distingue ainsi des personnes, des nombres et des temps que la chaîne sonore peut rapprocher ou confondre. C’est une difficulté grammaticale et morphologique autant que phonologique. Une dictée ne teste donc jamais seulement l’oreille : elle sollicite l’analyse de la phrase.

Le top 100 des formes courantes les plus irrégulières

Le classement porte sur des formes fléchies, pas seulement sur des lemmes. Les catégories sont celles de Lexique : VER pour verbe, NOM pour nom, ADJ pour adjectif, ADV pour adverbe, ADJ:num pour adjectif numéral et ADJ:int pour adjectif interrogatif.

Top 100 des formes courantes les plus irrégulières selon l’indice structurel. Fréquence dans les livres, par million de mots.
RangFormeCatégorieFréquenceIndice
1œufsNOM29,8099,6
2champsNOM52,9798,1
3chœurNOM24,8698,0
4campsNOM21,6297,6
5goûtsNOM17,0397,2
6attendsVER62,5797,0
7nœudNOM14,4697,0
8vœuxNOM10,6897,0
9centsADJ:num80,5496,9
10laissentVER22,3096,8
11tempsNOM1 289,3996,8
12eauxNOM42,0396,7
13connaissentVER16,8996,6
14vingtADJ:num154,5996,5
15aimentVER26,9696,4
16appellentVER16,0196,4
17oreillerNOM26,3596,3
18éveillerVER12,1696,3
19arrêtNOM46,8296,3
20scènesNOM19,6696,2
21veillerVER12,9195,9
22champNOM51,7695,8
23descendsVER12,1695,5
24quaisNOM18,8595,5
25commençaientVER20,2095,4
26commencentVER13,8595,3
27essayantVER22,5795,0
28essayaitVER35,8195,0
29allaientVER80,8894,8
30arrêtentVER10,8194,8
31attendentVER21,8294,8
32femmesNOM315,5494,7
33accueilNOM16,2294,6
34laissaientVER23,9294,5
35descendaientVER10,4194,5
36châteauxNOM10,7494,4
37connaissaientVER16,0894,3
38annonçaitVER21,9694,1
39allèrentVER11,6994,1
40aimaientVER16,4294,0
41mettentVER23,2494,0
42essayaisVER15,2794,0
43commençaitVER74,6693,9
44descendentVER10,4193,7
45oreillesNOM90,6893,6
46effetNOM173,1893,6
47récemmentADV15,0793,6
48attendVER74,4693,4
49dentsNOM114,5393,4
50rendsVER27,1693,4
51ventsNOM12,6493,4
52lentsADJ12,0393,4
53vintVER88,7293,4
54tintVER15,2093,4
55vœuNOM10,6193,4
56guerresNOM15,9593,4
57pensentVER12,3093,3
58atteignitVER10,3493,2
59beauxADJ63,7893,1
60peauxNOM13,5193,1
61occupaientVER10,3492,9
62scienceNOM24,9392,9
63descendVER32,6492,9
64îlesNOM24,6692,8
65baisséVER14,1292,7
66comptaitVER32,5092,7
67gaiementADV16,2292,7
68effetsNOM19,1992,6
69abbéNOM31,2892,6
70laisserVER192,0392,6
71lambeauxNOM10,7492,5
72aoûtNOM49,6692,5
73hallNOM25,8192,5
74changeaitVER18,1192,5
75attendaientVER32,7792,5
76songeaitVER17,3092,5
77quinzeADJ:num94,8092,5
78faisaientVER123,3892,5
79goûtNOM124,8092,4
80échoNOM32,5092,4
81mettaientVER19,3992,3
82mangeaitVER20,1492,2
83carreauxNOM28,1892,2
84faimNOM74,9392,2
85accueillirVER13,9992,0
86arrêtèrentVER10,0092,0
87commençaisVER14,7391,9
88descendaitVER33,4591,9
89seinsNOM51,8291,9
90longtempsADV335,5491,9
91gâteauxNOM18,2491,8
92campNOM75,6191,8
93âgesNOM12,1691,8
94quellesADJ:int35,9591,7
95quinzaineNOM11,6991,7
96caissesNOM18,3891,7
97desseinNOM10,2091,7
98âmesNOM22,0991,7
99apparemmentADV29,5391,6
100lançaitVER15,4191,6

Télécharger le classement. Le top 100 avec rang, forme, catégorie, fréquence et indice est disponible en CSV et en JSON.

Comment l’indice d’irrégularité structurelle a-t-il été construit ?

L’indice part d’un audit de Lexique-Infra 1.11, puis retient un corpus comparable de formes courantes et transforme quatre propriétés en rangs percentiles. Il mesure la prévisibilité de l’écriture depuis la prononciation, pas une probabilité individuelle de faute.

Audit de la source

La page officielle et l’article scientifique présentent Lexique-Infra comme une base de 137 717 mots. La distribution 1.11 téléchargée contient 137 824 lignes non vides et 121 055 formes orthographiques distinctes. L’écart peut refléter des corrections de version ou une différence de comptage ; faute de journal de modification qui l’explique explicitement, il est documenté plutôt qu’interprété.

Une même forme peut apparaître plusieurs fois si sa catégorie grammaticale ou sa prononciation change. Le classement principal exclut par prudence 15 117 graphies possédant plusieurs lignes dans la base.

Définition d’une forme courante

Une forme est retenue si elle contient uniquement des lettres, mesure de 4 à 20 lettres, n’a qu’une seule entrée dans Lexique-Infra et apparaît au moins 10 fois par million de mots dans le corpus de livres de Lexique 3.83. Ce filtre produit 4 098 formes ; il favorise une comparaison propre, mais écarte de nombreux homographes et mots rares. Le corpus est adulte, non spécifiquement scolaire.

Formule de l’indice

Composantes et pondérations de l’indice d’irrégularité.
ComposantePoidsInterprétation
Faible consistance phonème-graphème moyenne35 %Le son prédit mal l’écriture globale du mot.
Association la moins consistante25 %Au moins un segment est particulièrement improbable.
Part d’associations irrégulières25 %Plusieurs graphies ne sont pas les plus fréquentes pour leur son.
Complexité moyenne des graphèmes15 %Les graphèmes utilisent davantage de lettres.

Lexique-Infra définit une association comme régulière lorsqu’elle est la plus fréquente dans la direction étudiée. La complexité moyenne correspond au nombre moyen de lettres par graphème. Ces définitions viennent du manuel Lexique-Infra 1.11 et de l’article de Gimenes, Perret et New.

Test de sensibilité

Avec quatre poids égaux, la corrélation de rang avec l’indice principal atteint 0,9905. Dix-sept des vingt premières formes restent dans le top 20 ; œufs, champs et chœur occupent toujours les trois premières places. Le résultat n’est donc pas porté par un seul poids arbitraire.

Pourquoi cette étude ne dit-elle pas « les mots les plus mal orthographiés » ?

Une propriété du système et une erreur humaine ne sont pas la même mesure. Un mot peut être structurellement irrégulier mais parfaitement mémorisé parce qu’il est très fréquent ; un mot régulier peut être raté par manque d’attention ou de vocabulaire.

Pour affirmer qu’un mot est souvent mal orthographié, il faut observer des productions. Rey et ses collègues ont recueilli 200 millions de formes saisies dans un dictionnaire en ligne et comparé un échantillon à une dictée auprès de 100 étudiants ; les distributions d’erreurs étaient fortement corrélées, tout en montrant des biais liés à la tâche (PLOS ONE, 2019).

Notre atlas répond donc à une question plus précise : quelles formes sont les moins prévisibles depuis leur prononciation ? Une future validation pourra comparer cet indice à des erreurs observées dans des dictées.

Pourquoi Manulex n’est-il pas utilisé dans ce produit commercial ?

Manulex aurait permis de mieux approcher l’exposition des enfants, puisqu’il couvre 54 manuels, 1,9 million de mots, 48 886 formes et 23 812 lemmes. Mais ses données et résultats sont distribués sous licence CC BY-NC-SA 3.0, qui exclut l’usage commercial sans autorisation (page officielle des téléchargements).

Cette version utilise donc Lexique 3.83 et Lexique-Infra 1.11, sous licence CC BY-SA 4.0. L’attribution doit être conservée et la compatibilité de licence vérifiée lors de toute republication du jeu de données dérivé.

Ce que l’étude permet — et ne permet pas — de conclure

L’étude montre que certaines formes courantes sont très peu prévisibles depuis leur prononciation, que les finales muettes et verbales sont fortement représentées en tête du classement, que /ɛ/ et /e/ possèdent de nombreuses graphies utilisées et que la longueur entretient une relation presque nulle avec l’indice structurel.

Elle ne permet pas d’affirmer que œufs est le mot que les Français écrivent le plus souvent faux, que le score mesure une probabilité individuelle de faute, que les 4 098 formes représentent tout le vocabulaire d’un enfant, qu’une seule prononciation vaut pour toutes les régions francophones ou que l’indice est un test psychométrique validé.

Comment transformer l’atlas en outil pédagogique ?

Un outil pédagogique utile ne doit pas afficher seulement une note : il doit expliquer la segmentation en graphèmes, les sons associés, les associations rares, les lettres muettes, une famille morphologique utile, une phrase de mini-dictée et la règle correspondante.

Pour champs, par exemple, il faut signaler le graphème nasal, les lettres finales muettes, le pluriel et le rapprochement morphologique avec champêtre. L’explication pédagogique doit être validée humainement ; l’indice seul ne fournit pas la règle.

Questions fréquentes sur l’orthographe française

Pourquoi l’orthographe française est-elle difficile ?

Parce que la relation entre sons et graphies n’est pas biunivoque. Un son peut avoir plusieurs écritures, certaines lettres sont muettes et la grammaire ajoute des marques que l’on n’entend pas toujours.

Quel est le mot français le plus difficile à écrire ?

Il n’existe pas de réponse universelle. Dans notre corpus de formes courantes et selon un indice structurel transparent, œufs arrive en tête. Cela ne signifie pas qu’il provoque le plus de fautes observées.

Quel son a le plus d’orthographes en français ?

Dans Lexique-Infra, /ɛ/ possède 18 graphies attestées. Dix représentent chacune au moins 0,5 % des occurrences, notamment e, ai, ais, ait, è et ê.

Quelles sont les lettres muettes les plus fréquentes ?

Dans notre corpus, le graphème e muet est le plus présent, devant es, s, h, t, ts, ent et x. Les marques finales de nombre et de conjugaison expliquent une partie de ce classement.

Les mots longs sont-ils plus difficiles à écrire ?

Pas nécessairement. La corrélation entre longueur et indice structurel est de 0,04 dans notre corpus. Un mot court mais opaque peut être plus difficile qu’un mot long et régulier.

Comment apprendre les mots irréguliers ?

Il est plus efficace de combiner mémoire du mot, familles morphologiques, régularités positionnelles et pratique espacée. Une simple liste sans explication aide moins à transférer l’apprentissage vers de nouveaux mots.

Testez votre orthographe sur de vraies difficultés

Un test court identifie vos points faibles, puis les dictées ciblées vous font travailler les règles qui comptent vraiment.

Faire le test d’orthographe