Histoire
7 min de lecture

Unicode et UTF-8 : comprendre l'encodage des accents

Les problèmes d'encodage transforment vos accents en caractères illisibles. Comprenez Unicode et UTF-8 pour les éviter.

Publié le

Pourquoi vos accents se transforment-ils parfois en caractères illisiblescomme « é » ou « ç » ? La réponse tient en deux mots : Unicode et encodage.

Le problème historique

Dans les années 1960, le standard ASCII ne définissait que 128 caractères — suffisant pour l'anglais, mais pas pour le français. Chaque pays a créé ses propres extensions :

  • Latin-1 (ISO 8859-1) : pour les langues d'Europe occidentale
  • Windows-1252 : variante Microsoft de Latin-1
  • MacRoman : encodage des anciens Mac

Résultat : un fichier créé sur un système pouvait devenir illisible sur un autre.

La solution : Unicode

Unicode attribue un numéro unique à chaque caractère de toutes les langues du monde. Par exemple :

CaractèreCode UnicodeNom
ÉU+00C9Latin Capital Letter E With Acute
ÇU+00C7Latin Capital Letter C With Cedilla
ŒU+0152Latin Capital Ligature OE
€U+20ACEuro Sign

UTF-8 : l'encodage universel

UTF-8 est la méthode d'encodage Unicode la plus utilisée. Elle est compatible avec ASCII et supporte tous les caractères français.

Le « Mojibake » : caractères corrompus

Quand un texte UTF-8 est interprété comme Latin-1 (ou inversement), les accents deviennent des séquences de caractères bizarres :

Texte originalMojibake
éé
èè
çç
àà

Comment éviter les problèmes ?

  • Enregistrez toujours en UTF-8
  • Vérifiez l'encodage des fichiers reçus
  • Configurez vos bases de données en utf8mb4
  • En HTML, ajoutez <meta charset="UTF-8">
💡 Astuce : Si vous rencontrez des accents corrompus, l'outil Copier-Accent.frvous permet de copier les bons caractères pour corriger manuellement.

Questions fréquentes

C'est un problème d'encodage appelé 'Mojibake'. Le fichier a été enregistré dans un encodage (ex: UTF-8) et lu dans un autre (ex: Latin-1). La solution : convertir en UTF-8.

ASCII ne supporte que 128 caractères (pas d'accents). UTF-8 supporte plus d'un million de caractères, dont tous les accents français. UTF-8 est le standard moderne.

Dans Notepad++ : menu Encodage. Dans VS Code : en bas à droite de la fenêtre. La bonne pratique est de toujours utiliser UTF-8 pour les textes français.

À copier en un clic

Aller plus loin

UnicodeUTF-8encodageASCIIcaractères françaisMojibake

🔤 Copier les lettres mentionnées

Accédez directement aux pages de ces caractères pour les copier

Articles similaires

Continuez votre lecture avec ces guides complémentaires

Astuces6 min de lecture

Mes accents ne s'affichent pas : solutions aux problèmes d'encodage

Les accents qui se transforment en caractères illisibles sont un problème d'encodage courant. Voici comment le résoudre définitivement.

Tutoriel6 min de lecture

Caractères spéciaux en HTML et CSS : entités et codes Unicode

Développeurs web : maîtrisez les entités HTML et codes Unicode pour afficher correctement les accents et caractères spéciaux français.

Astuces4 min de lecture

Taper une flèche au clavier → ← ↑ ↓ : codes Alt, Windows et Mac

Taper une flèche au clavier n'a rien d'évident : voici les codes Alt, les raccourcis Mac et la méthode Word. Pour copier sans retenir un code, la page flèches suffit.

Tutoriel6 min de lecture

Accents français dans Excel : formules, tri et problèmes courants

Excel et les accents français ne font pas toujours bon ménage. Découvrez les solutions aux problèmes de tri, d'encodage CSV et de formules.

Histoire6 min de lecture

Pourquoi le clavier AZERTY n'a pas de majuscules accentuées ?

Le clavier AZERTY français date des machines à écrire et n'a jamais été optimisé pour les majuscules accentuées. Découvrez pourquoi et les alternatives.

Histoire6 min de lecture

Le clavier AZERTY amélioré (norme AFNOR) : tout savoir

Le clavier AZERTY amélioré résout enfin le problème des majuscules accentuées. Découvrez cette norme française moderne.