Atlas · 137 824 entrées auditées
Pourquoi l’orthographe française est-elle si difficile ?
L’orthographe française est difficile à produire parce qu’un même son peut s’écrire de plusieurs façons et que de nombreuses lettres ne se prononcent pas. Dans notre corpus de 4 098 formes courantes et non ambiguës, 48,8 % contiennent au moins un graphème muet. La longueur explique presque zéro variation de l’indice structurel : ρ = 0,04.
Réponse courte
L’orthographe française est difficile à produire parce qu’un même son peut s’écrire de plusieurs façons et que de nombreuses lettres ne se prononcent pas. Dans notre corpus de 4 098 formes courantes et non ambiguës, 48,8 % contiennent au moins un graphème muet. La longueur explique presque zéro variation de l’indice structurel : ρ = 0,04.
Les résultats essentiels
Indice d’irrégularité structurelle : 99,6.
1 998 formes sur 4 098.
18 graphies attestées dans Lexique-Infra.
Relation de rang presque nulle avec l’indice.
Quels sont les mots français courants les plus difficiles à écrire ?
Les cinq premières formes sont œufs, champs, chœur, camps et goûts. Leur difficulté vient d’un petit nombre de sons associés à plusieurs lettres, souvent complétés par une marque finale non prononcée.
| Rang | Forme | Fréquence | Consistance son → graphie | Irrégularités | Indice |
|---|---|---|---|---|---|
| 1 | œufs | 29,80 | 0,03 | 2 sur 2 | 99,6 |
| 2 | champs | 52,97 | 0,34 | 2 sur 3 | 98,1 |
| 3 | chœur | 24,86 | 0,35 | 2 sur 3 | 98,0 |
| 4 | camps | 21,62 | 0,21 | 2 sur 3 | 97,6 |
| 5 | goûts | 17,03 | 0,31 | 2 sur 3 | 97,2 |
| 6 | attends | 62,57 | 0,30 | 3 sur 4 | 97,0 |
| 7 | nœud | 14,46 | 0,34 | 2 sur 3 | 97,0 |
| 8 | vœux | 10,68 | 0,34 | 2 sur 3 | 97,0 |
| 9 | cents | 80,54 | 0,21 | 3 sur 3 | 96,9 |
| 10 | laissent | 22,30 | 0,39 | 3 sur 4 | 96,8 |
La fréquence n’annule pas l’irrégularité. Temps est extrêmement courant, mais sa forme écrite contient plus d’information que sa prononciation isolée. À l’inverse, un mot long peut être régulier si chaque son appelle une graphie très probable.
Pourquoi « œufs » arrive-t-il en tête ?
Œufs arrive en tête parce qu’il concentre cinq lettres dans seulement deux graphèmes selon la segmentation de Lexique-Infra. Sa consistance phonème-graphème moyenne pondérée par les occurrences n’est que de 0,03 et les deux associations sont classées comme irrégulières.
Le résultat ne signifie pas que œufs provoque toujours plus de fautes que champs ou temps. Il signifie que sa forme est peu déductible à partir de la chaîne sonore dans le système statistique décrit par Lexique-Infra.
La ligature est affichée ici sous la forme typographique œ. La base encode certaines formes avec les deux caractères oe ; cette normalisation d’affichage ne change aucun calcul.
Les reconnaître ne suffit pas : saurez-vous les écrire ? Le test d’orthographe repère vos erreurs récurrentes et vous oriente vers les bonnes règles.
Tester mon orthographeQuels sons français ont le plus d’orthographes possibles ?
Le son /ɛ/, comme dans paire, est le plus variable de notre analyse pratique : 18 graphies sont attestées et 10 représentent chacune au moins 0,5 % des occurrences. Le son /e/, comme dans été, et la voyelle nasale /ɛ̃/, comme dans cinq, suivent avec sept graphies au-dessus de ce seuil.
| Son | Graphies attestées | Graphies ≥ 0,5 % | Graphies les plus fréquentes |
|---|---|---|---|
| /ɛ/ | 18 | 10 | e 36,61 % ; ai 24,49 % ; ais 11,40 % ; ait 8,81 % ; è 8,30 % ; ê 5,51 % |
| /e/ | 15 | 7 | é 35,94 % ; e 29,94 % ; er 13,13 % ; ez 10,34 % ; et 8,30 % |
| /ɛ̃/ | 13 | 7 | en 44,44 % ; in 26,96 % ; ain 16,80 % ; im 5,99 % ; ein 4,31 % |
| /œ/ | 10 | 6 | eu 88,79 % ; oeu 5,33 % ; u 2,14 % ; e 1,55 % |
| /s/ | 10 | 6 | s 56,31 % ; c 22,03 % ; ss 10,69 % ; ç 7,31 % ; t 2,94 % |
| /j/ | 10 | 6 | i 86,08 % ; ill 4,66 % ; ll 3,25 % ; y 2,78 % ; il 1,80 % |
Une graphie très rare peut être limitée à une position ou à quelques mots ; le tableau distingue donc toutes les graphies attestées de celles dépassant 0,5 %. Les proportions sont calculées sur les occurrences de Lexique-Infra, pas sur une expérience de dictée.
L’asymétrie est centrale : lire part de la graphie pour retrouver le son, tandis qu’écrire sous dictée part du son pour sélectionner une graphie. Les travaux sur des élèves français montrent que la consistance phonème-graphème et la fréquence des mots ont chacune un effet propre sur la réussite orthographique (Lété, Peereman et Fayol, 2008).
Quelles lettres muettes sont les plus fréquentes ?
Le e muet domine largement : il apparaît comme graphème sans réalisation phonologique dans 977 des 4 098 formes du corpus, dont 967 fois en position finale. Viennent ensuite les graphèmes es, s, h, t, ts, ent et x.
| Graphème muet | Formes concernées | Dont en position finale | Exemples |
|---|---|---|---|
| e | 977 | 967 | abandonne, abattre, absence, absolue, accepte |
| es | 296 | 296 | actes, ailes, aimes, algues, allumettes |
| s | 262 | 262 | accès, acteurs, activités, ailleurs, airs |
| h | 98 | 0 | bonheur, cahier, envahit, habile |
| t | 95 | 95 | achat, affût, aperçoit, apparaît, appartient |
| ts | 80 | 80 | agents, amants, appartements, arts, avocats |
| ent | 67 | 67 | aiment, appellent, arrivent, arrivèrent |
| x | 62 | 62 | adieux, barreaux, bateaux, beaux, bijoux |
Au total, 48,8 % des formes sélectionnées contiennent au moins un graphème muet. Ce chiffre n’est pas directement comparable à l’estimation d’environ 30 % de mots du lexique terminés par une lettre muette rapportée par Mussar, Sénéchal et Rey : notre filtre vise des formes fréquentes de quatre lettres ou plus et compte tout graphème muet, pas seulement une lettre finale (étude de 2020).
Les lettres muettes ne sont pas toujours arbitraires. Certaines préservent une information morphologique : le t de chant réapparaît dans chanteur. Les connaissances morphologiques aident les enfants à construire ces représentations, même lorsque la consonne ne s’entend pas dans le mot isolé.
Les mots longs sont-ils forcément plus difficiles à écrire ?
Non : dans les 4 098 formes courantes du corpus, la corrélation de rang entre le nombre de lettres et l’indice structurel n’est que de 0,04. La longueur explique donc presque zéro variation de rang.
| Longueur | Nombre de formes | Indice médian |
|---|---|---|
| 4 lettres | 293 | 55,3 |
| 5 lettres | 523 | 51,9 |
| 6 lettres | 785 | 49,1 |
| 7 lettres | 827 | 47,9 |
| 8 lettres | 659 | 50,9 |
| 9 lettres | 456 | 52,8 |
| 10 lettres | 285 | 50,9 |
| 11 lettres | 142 | 53,5 |
| 12 lettres | 72 | 48,0 |
Un mot court comme eaux ou vingt peut être très difficile à reconstruire depuis le son. Un mot plus long peut multiplier des associations régulières et rester relativement prévisible. La longueur peut néanmoins peser sur la mémoire, la copie ou la probabilité d’une faute dans une tâche réelle ; notre résultat porte uniquement sur l’irrégularité du système.
Pourquoi les verbes occupent-ils presque la moitié du top 100 ?
Les verbes représentent 47 des 100 premières formes, contre 43 noms. Cette concentration vient des terminaisons qui ajoutent des lettres ou groupes de lettres peu ou pas audibles : aiment, laissent, appellent, commençaient, allaient, attendent.
Le français écrit distingue ainsi des personnes, des nombres et des temps que la chaîne sonore peut rapprocher ou confondre. C’est une difficulté grammaticale et morphologique autant que phonologique. Une dictée ne teste donc jamais seulement l’oreille : elle sollicite l’analyse de la phrase.
Le top 100 des formes courantes les plus irrégulières
Le classement porte sur des formes fléchies, pas seulement sur des lemmes. Les catégories sont celles de Lexique : VER pour verbe, NOM pour nom, ADJ pour adjectif, ADV pour adverbe, ADJ:num pour adjectif numéral et ADJ:int pour adjectif interrogatif.
| Rang | Forme | Catégorie | Fréquence | Indice |
|---|---|---|---|---|
| 1 | œufs | NOM | 29,80 | 99,6 |
| 2 | champs | NOM | 52,97 | 98,1 |
| 3 | chœur | NOM | 24,86 | 98,0 |
| 4 | camps | NOM | 21,62 | 97,6 |
| 5 | goûts | NOM | 17,03 | 97,2 |
| 6 | attends | VER | 62,57 | 97,0 |
| 7 | nœud | NOM | 14,46 | 97,0 |
| 8 | vœux | NOM | 10,68 | 97,0 |
| 9 | cents | ADJ:num | 80,54 | 96,9 |
| 10 | laissent | VER | 22,30 | 96,8 |
| 11 | temps | NOM | 1 289,39 | 96,8 |
| 12 | eaux | NOM | 42,03 | 96,7 |
| 13 | connaissent | VER | 16,89 | 96,6 |
| 14 | vingt | ADJ:num | 154,59 | 96,5 |
| 15 | aiment | VER | 26,96 | 96,4 |
| 16 | appellent | VER | 16,01 | 96,4 |
| 17 | oreiller | NOM | 26,35 | 96,3 |
| 18 | éveiller | VER | 12,16 | 96,3 |
| 19 | arrêt | NOM | 46,82 | 96,3 |
| 20 | scènes | NOM | 19,66 | 96,2 |
| 21 | veiller | VER | 12,91 | 95,9 |
| 22 | champ | NOM | 51,76 | 95,8 |
| 23 | descends | VER | 12,16 | 95,5 |
| 24 | quais | NOM | 18,85 | 95,5 |
| 25 | commençaient | VER | 20,20 | 95,4 |
| 26 | commencent | VER | 13,85 | 95,3 |
| 27 | essayant | VER | 22,57 | 95,0 |
| 28 | essayait | VER | 35,81 | 95,0 |
| 29 | allaient | VER | 80,88 | 94,8 |
| 30 | arrêtent | VER | 10,81 | 94,8 |
| 31 | attendent | VER | 21,82 | 94,8 |
| 32 | femmes | NOM | 315,54 | 94,7 |
| 33 | accueil | NOM | 16,22 | 94,6 |
| 34 | laissaient | VER | 23,92 | 94,5 |
| 35 | descendaient | VER | 10,41 | 94,5 |
| 36 | châteaux | NOM | 10,74 | 94,4 |
| 37 | connaissaient | VER | 16,08 | 94,3 |
| 38 | annonçait | VER | 21,96 | 94,1 |
| 39 | allèrent | VER | 11,69 | 94,1 |
| 40 | aimaient | VER | 16,42 | 94,0 |
| 41 | mettent | VER | 23,24 | 94,0 |
| 42 | essayais | VER | 15,27 | 94,0 |
| 43 | commençait | VER | 74,66 | 93,9 |
| 44 | descendent | VER | 10,41 | 93,7 |
| 45 | oreilles | NOM | 90,68 | 93,6 |
| 46 | effet | NOM | 173,18 | 93,6 |
| 47 | récemment | ADV | 15,07 | 93,6 |
| 48 | attend | VER | 74,46 | 93,4 |
| 49 | dents | NOM | 114,53 | 93,4 |
| 50 | rends | VER | 27,16 | 93,4 |
| 51 | vents | NOM | 12,64 | 93,4 |
| 52 | lents | ADJ | 12,03 | 93,4 |
| 53 | vint | VER | 88,72 | 93,4 |
| 54 | tint | VER | 15,20 | 93,4 |
| 55 | vœu | NOM | 10,61 | 93,4 |
| 56 | guerres | NOM | 15,95 | 93,4 |
| 57 | pensent | VER | 12,30 | 93,3 |
| 58 | atteignit | VER | 10,34 | 93,2 |
| 59 | beaux | ADJ | 63,78 | 93,1 |
| 60 | peaux | NOM | 13,51 | 93,1 |
| 61 | occupaient | VER | 10,34 | 92,9 |
| 62 | science | NOM | 24,93 | 92,9 |
| 63 | descend | VER | 32,64 | 92,9 |
| 64 | îles | NOM | 24,66 | 92,8 |
| 65 | baissé | VER | 14,12 | 92,7 |
| 66 | comptait | VER | 32,50 | 92,7 |
| 67 | gaiement | ADV | 16,22 | 92,7 |
| 68 | effets | NOM | 19,19 | 92,6 |
| 69 | abbé | NOM | 31,28 | 92,6 |
| 70 | laisser | VER | 192,03 | 92,6 |
| 71 | lambeaux | NOM | 10,74 | 92,5 |
| 72 | août | NOM | 49,66 | 92,5 |
| 73 | hall | NOM | 25,81 | 92,5 |
| 74 | changeait | VER | 18,11 | 92,5 |
| 75 | attendaient | VER | 32,77 | 92,5 |
| 76 | songeait | VER | 17,30 | 92,5 |
| 77 | quinze | ADJ:num | 94,80 | 92,5 |
| 78 | faisaient | VER | 123,38 | 92,5 |
| 79 | goût | NOM | 124,80 | 92,4 |
| 80 | écho | NOM | 32,50 | 92,4 |
| 81 | mettaient | VER | 19,39 | 92,3 |
| 82 | mangeait | VER | 20,14 | 92,2 |
| 83 | carreaux | NOM | 28,18 | 92,2 |
| 84 | faim | NOM | 74,93 | 92,2 |
| 85 | accueillir | VER | 13,99 | 92,0 |
| 86 | arrêtèrent | VER | 10,00 | 92,0 |
| 87 | commençais | VER | 14,73 | 91,9 |
| 88 | descendait | VER | 33,45 | 91,9 |
| 89 | seins | NOM | 51,82 | 91,9 |
| 90 | longtemps | ADV | 335,54 | 91,9 |
| 91 | gâteaux | NOM | 18,24 | 91,8 |
| 92 | camp | NOM | 75,61 | 91,8 |
| 93 | âges | NOM | 12,16 | 91,8 |
| 94 | quelles | ADJ:int | 35,95 | 91,7 |
| 95 | quinzaine | NOM | 11,69 | 91,7 |
| 96 | caisses | NOM | 18,38 | 91,7 |
| 97 | dessein | NOM | 10,20 | 91,7 |
| 98 | âmes | NOM | 22,09 | 91,7 |
| 99 | apparemment | ADV | 29,53 | 91,6 |
| 100 | lançait | VER | 15,41 | 91,6 |
Télécharger le classement. Le top 100 avec rang, forme, catégorie, fréquence et indice est disponible en CSV et en JSON.
Comment l’indice d’irrégularité structurelle a-t-il été construit ?
L’indice part d’un audit de Lexique-Infra 1.11, puis retient un corpus comparable de formes courantes et transforme quatre propriétés en rangs percentiles. Il mesure la prévisibilité de l’écriture depuis la prononciation, pas une probabilité individuelle de faute.
Audit de la source
La page officielle et l’article scientifique présentent Lexique-Infra comme une base de 137 717 mots. La distribution 1.11 téléchargée contient 137 824 lignes non vides et 121 055 formes orthographiques distinctes. L’écart peut refléter des corrections de version ou une différence de comptage ; faute de journal de modification qui l’explique explicitement, il est documenté plutôt qu’interprété.
Une même forme peut apparaître plusieurs fois si sa catégorie grammaticale ou sa prononciation change. Le classement principal exclut par prudence 15 117 graphies possédant plusieurs lignes dans la base.
Définition d’une forme courante
Une forme est retenue si elle contient uniquement des lettres, mesure de 4 à 20 lettres, n’a qu’une seule entrée dans Lexique-Infra et apparaît au moins 10 fois par million de mots dans le corpus de livres de Lexique 3.83. Ce filtre produit 4 098 formes ; il favorise une comparaison propre, mais écarte de nombreux homographes et mots rares. Le corpus est adulte, non spécifiquement scolaire.
Formule de l’indice
| Composante | Poids | Interprétation |
|---|---|---|
| Faible consistance phonème-graphème moyenne | 35 % | Le son prédit mal l’écriture globale du mot. |
| Association la moins consistante | 25 % | Au moins un segment est particulièrement improbable. |
| Part d’associations irrégulières | 25 % | Plusieurs graphies ne sont pas les plus fréquentes pour leur son. |
| Complexité moyenne des graphèmes | 15 % | Les graphèmes utilisent davantage de lettres. |
Lexique-Infra définit une association comme régulière lorsqu’elle est la plus fréquente dans la direction étudiée. La complexité moyenne correspond au nombre moyen de lettres par graphème. Ces définitions viennent du manuel Lexique-Infra 1.11 et de l’article de Gimenes, Perret et New.
Test de sensibilité
Avec quatre poids égaux, la corrélation de rang avec l’indice principal atteint 0,9905. Dix-sept des vingt premières formes restent dans le top 20 ; œufs, champs et chœur occupent toujours les trois premières places. Le résultat n’est donc pas porté par un seul poids arbitraire.
Pourquoi cette étude ne dit-elle pas « les mots les plus mal orthographiés » ?
Une propriété du système et une erreur humaine ne sont pas la même mesure. Un mot peut être structurellement irrégulier mais parfaitement mémorisé parce qu’il est très fréquent ; un mot régulier peut être raté par manque d’attention ou de vocabulaire.
Pour affirmer qu’un mot est souvent mal orthographié, il faut observer des productions. Rey et ses collègues ont recueilli 200 millions de formes saisies dans un dictionnaire en ligne et comparé un échantillon à une dictée auprès de 100 étudiants ; les distributions d’erreurs étaient fortement corrélées, tout en montrant des biais liés à la tâche (PLOS ONE, 2019).
Notre atlas répond donc à une question plus précise : quelles formes sont les moins prévisibles depuis leur prononciation ? Une future validation pourra comparer cet indice à des erreurs observées dans des dictées.
Pourquoi Manulex n’est-il pas utilisé dans ce produit commercial ?
Manulex aurait permis de mieux approcher l’exposition des enfants, puisqu’il couvre 54 manuels, 1,9 million de mots, 48 886 formes et 23 812 lemmes. Mais ses données et résultats sont distribués sous licence CC BY-NC-SA 3.0, qui exclut l’usage commercial sans autorisation (page officielle des téléchargements).
Cette version utilise donc Lexique 3.83 et Lexique-Infra 1.11, sous licence CC BY-SA 4.0. L’attribution doit être conservée et la compatibilité de licence vérifiée lors de toute republication du jeu de données dérivé.
Ce que l’étude permet — et ne permet pas — de conclure
L’étude montre que certaines formes courantes sont très peu prévisibles depuis leur prononciation, que les finales muettes et verbales sont fortement représentées en tête du classement, que /ɛ/ et /e/ possèdent de nombreuses graphies utilisées et que la longueur entretient une relation presque nulle avec l’indice structurel.
Elle ne permet pas d’affirmer que œufs est le mot que les Français écrivent le plus souvent faux, que le score mesure une probabilité individuelle de faute, que les 4 098 formes représentent tout le vocabulaire d’un enfant, qu’une seule prononciation vaut pour toutes les régions francophones ou que l’indice est un test psychométrique validé.
Comment transformer l’atlas en outil pédagogique ?
Un outil pédagogique utile ne doit pas afficher seulement une note : il doit expliquer la segmentation en graphèmes, les sons associés, les associations rares, les lettres muettes, une famille morphologique utile, une phrase de mini-dictée et la règle correspondante.
Pour champs, par exemple, il faut signaler le graphème nasal, les lettres finales muettes, le pluriel et le rapprochement morphologique avec champêtre. L’explication pédagogique doit être validée humainement ; l’indice seul ne fournit pas la règle.
Questions fréquentes
Questions fréquentes sur l’orthographe française
Pourquoi l’orthographe française est-elle difficile ?
Parce que la relation entre sons et graphies n’est pas biunivoque. Un son peut avoir plusieurs écritures, certaines lettres sont muettes et la grammaire ajoute des marques que l’on n’entend pas toujours.
Quel est le mot français le plus difficile à écrire ?
Il n’existe pas de réponse universelle. Dans notre corpus de formes courantes et selon un indice structurel transparent, œufs arrive en tête. Cela ne signifie pas qu’il provoque le plus de fautes observées.
Quel son a le plus d’orthographes en français ?
Dans Lexique-Infra, /ɛ/ possède 18 graphies attestées. Dix représentent chacune au moins 0,5 % des occurrences, notamment e, ai, ais, ait, è et ê.
Quelles sont les lettres muettes les plus fréquentes ?
Dans notre corpus, le graphème e muet est le plus présent, devant es, s, h, t, ts, ent et x. Les marques finales de nombre et de conjugaison expliquent une partie de ce classement.
Les mots longs sont-ils plus difficiles à écrire ?
Pas nécessairement. La corrélation entre longueur et indice structurel est de 0,04 dans notre corpus. Un mot court mais opaque peut être plus difficile qu’un mot long et régulier.
Comment apprendre les mots irréguliers ?
Il est plus efficace de combiner mémoire du mot, familles morphologiques, régularités positionnelles et pratique espacée. Une simple liste sans explication aide moins à transférer l’apprentissage vers de nouveaux mots.
Transparence
Sources et attribution
- Lexique — Lexique-Infra 1.11, base et documentation
- Gimenes, Perret et New (2020) — article Lexique-Infra
- OpenLexicon — documentation et licence
- OpenLexicon — corpus Lexique 3.83
- Lété, Peereman et Fayol (2008) — consistance et fréquence en orthographe
- Mussar, Sénéchal et Rey (2020) — connaissances morphologiques
- Rey et al. (2019) — performances orthographiques sur le web et en laboratoire
- Manulex — données et licence CC BY-NC-SA 3.0
- Lexique — manuel des codes phonétiques
Passer de l’analyse à la pratique
Testez votre orthographe sur de vraies difficultés
Un test court identifie vos points faibles, puis les dictées ciblées vous font travailler les règles qui comptent vraiment.
Faire le test d’orthographe