Comprimeren
X-Mozilla-StatusDe handeling die verwijderde berichten daadwerkelijk uit een mbox-bestand haalt. Tot die is uitgevoerd, is een verwijderd bericht alleen als verwijderd gemarkeerd — het staat nog in het bestand en is nog leesbaar.
Thunderbird en andere mbox-gebaseerde clients herschrijven niet bij elke verwijdering de hele mailbox; dat zou veel te traag zijn. In plaats daarvan zetten ze een vlag in de headers van het bericht — X-Mozilla-Status en X-Mozilla-Status2 — die het als verwijderd markeert, en gaan verder. De bytes blijven precies waar ze stonden. Comprimeren is de aparte stap die het bestand zonder de gemarkeerde berichten herschrijft en de ruimte vrijmaakt.
Dat verklaart een bekende verrassing: een map die vierduizend berichten toont en negen gigabyte in beslag neemt. Het verschil is verwijderde post die nooit is weggecomprimeerd. Het verklaart ook waarom een uit het profiel gekopieerde mailbox berichten kan tonen die de eigenaar allang gewist waande: een externe lezer heeft geen reden om een vlag te respecteren die Thunderbird zelf verzon.
Voordat je een mailbox splitst, kopieert of overhandigt, is het de moeite waard bewust te kiezen: eerst comprimeren als die berichten niet mee horen te reizen, of het welbewust overslaan als ze deel uitmaken van wat je wilt bewaren. Tel in beide gevallen daarna de berichten, zodat je weet wat je werkelijk hebt.
Verwante begrippen
Een tekstbestand dat meerdere e-mailberichten achter elkaar opslaat, elk beginnend met een scheidingsregel "From ". Dit is het formaat dat Google Takeout produceert bij het exporteren van je Gmail-archief.
Het opsporen en verwijderen van dubbele e-mailberichten uit een archief, doorgaans door Message-ID-waarden te vergelijken, om redundantie te voorkomen bij het samenvoegen van meerdere MBOX-bestanden.
Een parsetechniek die een bestand stapsgewijs in kleine stukken leest in plaats van het volledige bestand in één keer in het geheugen te laden, waarmee tools zeer grote MBOX-bestanden van tientallen of honderden gigabytes kunnen openen en indexeren met een laag geheugengebruik.