Skip to content
Mbox Viewer Pro
mboxarchivesproduct

Comment ouvrir un fichier MBOX de 50 Go

Si les gros fichiers MBOX font tomber les lecteurs, ce n'est pas parce qu'ils sont abîmés : c'est parce que la plupart des lecteurs chargent tout le fichier en mémoire d'abord. Ce que changent une lecture en flux et un index, chiffres à l'appui.

David Carrero ·

Utilisez un lecteur qui parcourt le fichier en flux au lieu de le charger. Avec celui-là, une boîte de 50 Go d’environ un demi-million de messages s’ouvre en moins de cinq minutes, reste sous les 600 Mo de RAM, et se rouvre ensuite en moins d’une seconde. Sans lui, la taille de votre fichier n’a aucune importance : le lecteur s’effondrera de toute façon quelque part entre 500 Mo et 2 Go.

Pourquoi tout le reste s’étrangle-t-il ?

Parce que la façon la plus directe d’écrire un lecteur de courrier consiste à analyser le fichier, à construire une liste de messages en mémoire, puis à l’afficher. Cela marche à merveille pendant les tests, où la boîte d’exemple pèse 40 Mo.

Puis quelqu’un ouvre un export Gmail. L’analyseur veut désormais garder un demi-million de messages en RAM d’un coup, le processus dépasse ce dont la machine dispose, et vous obtenez un indicateur d’attente qui ne s’arrête jamais, un plantage ou — pire que tout — une fenêtre qui apparaît au bout de vingt minutes et saccade à chaque clic.

Le fichier n’est pas le problème. Un MBOX de 50 Go est un MBOX parfaitement ordinaire ; le format n’a pas de limite de taille et n’en a jamais eu. Ce qui a une limite, c’est le postulat selon lequel tout tient en mémoire.

Ce que « lire en flux » veut dire concrètement

Un analyseur en flux parcourt le fichier par petits morceaux — Mbox Viewer utilise un tampon de 1 Mo — et note où commence chaque message au lieu de conserver le message lui-même. La mémoire utilisée dépend du nombre de messages, pas de leur taille, et un cache garde la poignée de ceux que vous êtes en train de lire.

Conséquence pratique : ouvrir une archive de 50 Go coûte à peu près autant de RAM qu’en ouvrir une de 500 Mo. Les chiffres que nous publions, tirés de la page des fonctionnalités :

TailleMessagesPremière ouvertureRéouvertureRAM
500 Mo~5 000< 5 s< 1 s< 100 Mo
5 Go~50 000< 30 s< 1 s< 200 Mo
50 Go~500 000< 5 min< 1 s< 600 Mo

Pourquoi la deuxième ouverture est instantanée

Parce que ce premier passage produit quelque chose qui mérite d’être conservé : un index binaire indiquant où commence chaque message. Rouvrir la boîte revient à charger l’index, pas à relire 50 Go.

L’index est validé par SHA-256 : si la boîte aux lettres change sous ses pieds — vous avez remplacé le fichier, ou vous y avez ajouté du courrier —, l’application s’en aperçoit et le reconstruit au lieu de vous montrer une liste périmée. Il vit en dehors de votre boîte, qui reste octet pour octet ce qu’elle était.

Cinq minutes une fois, une seconde à chaque fois ensuite. Pour une archive que l’on consulte de loin en loin pendant des années, ce rapport fait toute la différence entre un fichier qu’on utilise et un fichier qu’on évite.

La recherche fonctionne-t-elle encore à cette taille ?

Oui, et c’est bien pour cela qu’on se donne cette peine. Un demi-million de messages, cela ne se fait pas défiler : cela s’interroge. from:, to:, subject:, body:, date:, has:attachment, size:>, les expressions exactes, OR et la négation — l’aide-mémoire contient le jeu complet.

La recherche dans le corps lit réellement le courrier ; sur une très grande archive, elle se compte donc en secondes plutôt qu’en instantané. Les recherches sur les en-têtes — expéditeur, objet, date — répondent immédiatement, et elles suffisent à la plupart des questions.

Faut-il plutôt découper le fichier ?

Parfois, mais moins souvent qu’on ne le croit. Le découpage vaut la peine quand vous avez réellement besoin des morceaux séparément : un fichier par année pour l’archivage, ou une tranche à remettre à quelqu’un. Il ne vaut pas la peine dans le seul but de rendre le fichier ouvrable, parce qu’il ne règle rien si le problème de votre lecteur, c’est le lecteur.

Si vous voulez vraiment découper, nous avons un guide pour les grosses boîtes Thunderbird. Et si ce qu’il vous faut, c’est remettre un sous-ensemble, exporter une sélection sous forme de nouveau MBOX est plus propre : réduisez par la recherche ou les filtres à ce qui est concerné, écrivez ces messages dans un nouveau fichier, et laissez l’original tranquille.

Notes pratiques pour les très grandes archives

  • Espace disque : il vous faut de la place pour l’index, pas pour une copie du courrier. Cela représente une fraction de la boîte.
  • Ne la posez pas sur un partage réseau pour la première ouverture. Lire en flux, c’est parcourir le fichier entier une fois, et le faire par Wi-Fi transforme cinq minutes en après-midi. Copiez la boîte en local, ouvrez-la, remettez-la en place.
  • Exports Takeout en plusieurs parties : Google découpe les très grandes boîtes en plusieurs fichiers. Chacun s’ouvre séparément, et ils peuvent être fusionnés en une seule boîte, les doublons étant écartés par Message-ID si les parties se recouvrent.
  • La version gratuite ouvre jusqu’à 1 Go. Au-delà, c’est un achat unique — pas d’abonnement, pas de compte.

Ouvrez votre archive avec Mbox Viewer

Application native pour Mac et Windows. Lit en streaming des fichiers MBOX et EML de toute taille, entièrement hors ligne.