DocsME
14 min de lectureDocsMe Team

Qu'est-ce que l'Encodage Base64 ?

Comprenez ce qu'est l'encodage Base64, pourquoi il existe, ce qu'il change dans un fichier et son lien avec la conversion d'un PDF en chaîne Base64.

  • qu est ce que l encodage base64
  • definition base64
  • base64 explique
  • pdf me

Définition

Base64 est un schéma d'encodage du binaire vers le texte. Il représente toute séquence d'octets — un PDF, une image, une police, une clé de chiffrement — en utilisant seulement 64 caractères ASCII imprimables : les lettres de A à Z et de a à z, les chiffres de 0 à 9, et deux symboles supplémentaires, généralement + et /.

Comme la sortie n'utilise que des caractères courants et imprimables, elle peut traverser sans problème des systèmes conçus pour transporter du texte plutôt que des données binaires quelconques.

Pourquoi Il Existe

Beaucoup de protocoles et de formats sur lesquels repose le web — les anciens standards d'email, JSON, XML et les URL — ont été conçus autour du texte, pas des octets bruts. Certains de ces canaux suppriment, modifient ou rejettent purement et simplement certaines valeurs d'octet.

Base64 contourne le problème en réexprimant d'abord le contenu binaire en texte. C'est la même idée derrière la conversion d'un PDF en Base64 : les octets du fichier deviennent une chaîne que n'importe quel champ texte peut contenir.

Ce que Ce N'est Pas

Base64 n'est ni un chiffrement ni une compression. Il ne cache ni ne protège les données — n'importe qui peut le décoder instantanément — et la sortie encodée est toujours plus grande que l'entrée, jamais plus petite.

Ce n'est pas non plus un format de fichier. Il ne sait pas si les octets qu'il représente sont un PDF, un JPEG ou autre chose ; cette information doit voyager séparément, généralement dans un champ distinct ou dans le cadre d'un data URI.

Le Lien avec les PDF

Un PDF n'est qu'une séquence d'octets comme n'importe quel autre fichier, donc il s'encode de la même façon qu'une image ou une police. Pour le mécanisme de la conversion, voir comment fonctionne l'encodage Base64, et pour un guide complet, voir le guide PDF en Base64.

Des Octets aux Caractères Base64

Base64 traite le fichier d'origine par groupes de 3 octets — 24 bits — à la fois. Chaque groupe de 24 bits est divisé en quatre blocs de 6 bits, et chaque bloc de 6 bits (un nombre de 0 à 63) est recherché dans un alphabet fixe pour produire un caractère de sortie. Trois octets entrent, quatre caractères sortent.

C'est pourquoi toute chaîne Base64 est construite à partir des mêmes 64 symboles, quel que soit le type de fichier — un PDF, une image, une police — qui a été encodé. Voir ce qu'est l'encodage Base64 pour la vue d'ensemble.

L'Alphabet Base64

Les 64 valeurs possibles sur 6 bits correspondent : aux lettres majuscules A–Z (valeurs 0–25), aux lettres minuscules a–z (valeurs 26–51), aux chiffres 0–9 (valeurs 52–61) et enfin à + et / (valeurs 62 et 63). Certaines variantes remplacent ces deux derniers symboles — le Base64 compatible URL utilise - et _ à la place, pour que la chaîne puisse circuler sans risque dans une URL.

Le Padding Avec =

Un groupe de 24 bits ne se forme proprement que lorsque la longueur de l'entrée est un multiple de 3 octets. Quand il ne reste que 1 ou 2 octets pour le dernier groupe d'un fichier, Base64 complète les bits manquants avec des zéros et ajoute un ou deux caractères = à la fin de la sortie, afin que les décodeurs sachent exactement combien des derniers bits étaient de vraies données.

Le padding ne transporte aucune information du fichier — il marque seulement où s'arrête le contenu réel, afin qu'un décodeur sache où s'arrêter.

Un Petit Exemple Détaillé

Encoder les deux lettres « Hi » produit la chaîne « SGk= ». Les octets de H et i forment 16 bits, qui se divisent en trois blocs complets de 6 bits plus 2 bits restants complétés par des zéros — trois caractères réels (S, G, k) suivis d'un caractère = de padding, car l'entrée comptait 2 octets, pas un multiple de 3.

Pourquoi la Sortie Est Environ 33 % Plus Grande

Trois octets de données binaires deviennent toujours quatre caractères de texte, un rapport de 4:3 — environ 33 % de plus. Un PDF de 900 Ko sur le disque devient une chaîne Base64 proche de 1,2 Mo. C'est le principal compromis à anticiper ; voir les indications de taille dans le guide PDF en Base64.

Encodage

Le processus de conversion de données d'une représentation à une autre — ici, transformer les octets binaires d'un PDF en une chaîne de texte Base64. Voir comment fonctionne l'encodage Base64 pour le mécanisme.

Décodage

L'inverse de l'encodage : reconvertir une chaîne Base64 dans les octets binaires d'origine. Un PDF correctement décodé est identique, octet pour octet, au fichier qui a été encodé.

Data URI

Une chaîne qui combine une valeur encodée en Base64 avec un préfixe décrivant son type de fichier, sous la forme data:application/pdf;base64,.... Les navigateurs et certains lecteurs utilisent ce préfixe pour savoir comment afficher les données. Voir Base64 vs Data URI pour savoir quand chaque forme s'applique.

Données Binaires

Des données stockées sous forme d'octets bruts plutôt que de texte lisible par un humain. Un PDF, comme tout format de fichier, est une donnée binaire au niveau de l'octet, quelle que soit la quantité de texte qu'il contient visuellement.

Type MIME

Une étiquette telle que application/pdf qui identifie le type de contenu d'une donnée. Les API et les navigateurs utilisent le type MIME pour décider comment traiter, afficher ou décoder un fichier.

Payload API

Les données envoyées dans le corps d'une requête ou d'une réponse API. Un PDF encodé en Base64 se trouve souvent dans un payload JSON comme l'un de plusieurs champs — voir comment utiliser un PDF Base64 dans une requête API JSON pour une structure typique.