Deduplikation

Aus Xinux Wiki
Version vom 20. August 2026, 05:13 Uhr von Thomas.will (Diskussion | Beiträge) (Die Seite wurde neu angelegt: „'''Deduplikation''' bezeichnet das Erkennen und Zusammenfassen identischer Datenblöcke. Statt denselben Inhalt mehrfach zu speichern, wird er nur einmal abgel…“)
(Unterschied) ← Nächstältere Version | Aktuelle Version (Unterschied) | Nächstjüngere Version → (Unterschied)
Zur Navigation springen Zur Suche springen

Deduplikation bezeichnet das Erkennen und Zusammenfassen identischer Datenblöcke. Statt denselben Inhalt mehrfach zu speichern, wird er nur einmal abgelegt; alle weiteren Vorkommen verweisen auf denselben Block. Das spart Platz, ohne dass für den Nutzer etwas anders aussieht – jede Datei bleibt als eigene Datei sichtbar.

Wie es funktioniert

  • Über jeden Block wird eine Prüfsumme (Hash) gebildet.
  • Treffen zwei Blöcke auf denselben Hash, wird der zweite nicht neu geschrieben, sondern durch einen Verweis auf den ersten ersetzt.
  • Ändert sich später einer der Blöcke, wird dank Copy-on-Write eine eigene Kopie angelegt – die anderen Verweise bleiben unberührt.

Zwei Zeitpunkte

Inline
  • Die Prüfung läuft schon beim Schreiben. Doppelte Blöcke landen gar nicht erst auf der Platte. Kostet Rechenzeit und Arbeitsspeicher während des Schreibens.
Offline (nachgelagert)
  • Die Daten werden zunächst normal geschrieben, ein späterer Lauf sucht die Dubletten und räumt auf. Belastet das laufende Schreiben nicht, braucht aber zwischenzeitlich den vollen Platz.

Bei Btrfs

Btrfs beherrscht keine automatische Inline-Deduplikation im Kernel. Stattdessen arbeitet man nachgelagert mit Zusatzwerkzeugen wie duperemove oder bees, die das Dateisystem nach gleichen Blöcken durchsuchen und sie über den Reflink-Mechanismus zusammenlegen.

Abgrenzung

  • Deduplikation entfernt gleiche Blöcke über Dateigrenzen hinweg – auch zwischen völlig verschiedenen Dateien.
  • Kompression verkleinert die Blöcke selbst, unabhängig davon, ob sie doppelt vorkommen.
  • Beides lässt sich kombinieren.

Wo es sich lohnt

  • Viele ähnliche virtuelle Maschinen oder Container-Images.
  • Backup-Server mit vielen fast identischen Ständen.
  • Weniger sinnvoll bei bereits einzigartigen Daten (Fotos, Videos, verschlüsselte Dateien) – dort findet die Deduplikation kaum Dubletten und kostet nur Rechenzeit.