Parquet (Apache) — fichier .parquet

pérenne

Format de stockage de données colonnaire, standard du traitement de données à grande échelle.

Le Parquet stocke des données non pas ligne par ligne comme un CSV, mais colonne par colonne, une organisation particulièrement efficace pour les requêtes analytiques qui ne portent que sur certaines colonnes d’un très gros jeu de données. C’est aujourd’hui l’un des formats de référence du traitement de données à grande échelle (Apache Spark, Hadoop, entrepôts de données cloud).

Particularité de sa signature : la chaîne “PAR1” apparaît à la fois en tout début de fichier et en toute fin, juste avant les métadonnées du footer — une double vérification qui permet de confirmer qu’un fichier Parquet n’a pas été tronqué lors d’un transfert.

Contrairement au CSV, lisible directement par un humain, le Parquet nécessite un outil dédié pour être exploité, mais offre en échange une compression bien plus efficace et des performances de lecture largement supérieures sur de gros volumes de données structurées.

Le stockage par colonne permet également d’appliquer un algorithme de compression adapté à chaque colonne individuellement — une colonne de dates se compresse très différemment d’une colonne de texte libre — ce qui explique en grande partie ses gains de taille par rapport à un CSV équivalent.

Un moteur de requête peut ignorer entièrement les colonnes non concernées par une requête donnée, ne lisant sur le disque que les octets réellement nécessaires — un avantage déterminant sur des tables comptant des centaines de colonnes dont une requête n’exploite qu’une poignée.

Des services d’entrepôt de données cloud comme Amazon Athena ou Google BigQuery peuvent interroger directement des fichiers Parquet stockés dans un espace de stockage objet, sans étape de chargement préalable dans une base de données traditionnelle, une capacité qui a largement contribué à en faire un format pivot des architectures analytiques modernes basées sur le cloud.

Signature binaire

Diagramme de la signature binaire du format Parquet (Apache), octets mis en évidence
HexadécimalOffset
50 41 52 310

Vérifier qu'un fichier porte bien cette signature →

Questions fréquentes

Comment ouvrir un fichier .parquet ?

Apache Spark / pandas (bibliothèques de données) permet d'ouvrir gratuitement un fichier .parquet. Voir la liste complète des logiciels compatibles ci-contre.

Quel est le type MIME du format Parquet (Apache) ?

Le type MIME du format Parquet (Apache) est application/vnd.apache.parquet.

Le format Parquet (Apache) (.parquet) est-il encore utilisé aujourd'hui ?

Oui, le format Parquet (Apache) est pérenne : il reste activement utilisé et pris en charge par les logiciels actuels.

Peut-on ouvrir un fichier .parquet sur mobile, sans installer d'application ?

Oui : Apache Spark / pandas (bibliothèques de données) fonctionne directement depuis le navigateur d'un smartphone ou d'une tablette, sans application dédiée à installer.

Pourquoi mon fichier .parquet ne s'ouvre-t-il pas ?

Les causes les plus fréquentes sont l'absence de logiciel compatible installé, un téléchargement ou un transfert incomplet, ou une extension qui ne correspond plus au contenu réel du fichier. Voir le guide complet sur les causes possibles, ou vérifier le format réel avec l'identifieur de fichier.

SQLite, CSV, Parquet : quel format choisir pour stocker des données →

Un fichier ne s'ouvre pas : les causes possibles →

Comment savoir si un fichier est corrompu →

Sources

Dernière mise à jour :