Binär und Text umwandeln

Text in Binär, Hexadezimal oder Dezimal und wieder zurück — über die Bytes der UTF-8-Kodierung.

10 Zeichen belegen in UTF-8 10 Bytes.

Ergebnis
01001000 01100001 01101100 01101100 01101111 00100000 01010111 01100101 01101100 01110100
Bytes
10
Zeichen
10
Bytes je Zeichen
1 im Schnitt
Hinweis
Reiner ASCII-Text — ein Byte je Zeichen.

Ein Text besteht im Speicher aus Bytes, und wie Zeichen zu Bytes werden, entscheidet die Kodierung. UTF-8 ist heute der Standard: Es braucht für lateinische Buchstaben ein Byte, für Umlaute zwei, für die meisten asiatischen Zeichen drei und für Emojis vier.

Dieses Werkzeug zeigt genau diese Bytes — als Bits, als Hexzahlen oder dezimal — und findet aus einer solchen Folge auch wieder den Text.

Warum ein Umlaut zwei Bytes braucht

UTF-8 ist eine Kodierung variabler Länge. Die ersten 128 Zeichen entsprechen dem alten ASCII und passen in ein Byte, dessen höchstes Bit null ist. Alles darüber beginnt mit einem Byte, dessen führende Einsen verraten, wie viele Bytes folgen.

Das ist der Grund, warum ein deutscher Text mehr Bytes hat als Zeichen, und warum eine Datenbankspalte für „255 Zeichen“ je nach Definition nur 85 Emojis fasst. Wer Speichergrenzen plant, muss Bytes zählen, nicht Zeichen.

Acht Bits, ein Byte

In der binären Darstellung steht jedes Byte als Gruppe von acht Ziffern, weil führende Nullen sonst verloren gingen. Beim Zurückwandeln akzeptiert dieses Werkzeug Gruppen mit und ohne Trennzeichen, solange sie sich sauber in Achtergruppen zerlegen lassen.

Hexadezimal ist die kompaktere Schreibweise für dieselben Bytes: Zwei Hexziffern sind genau ein Byte. Deshalb liest man in Datei-Editoren und Netzwerkmitschnitten praktisch immer Hex und nicht Binär.

Häufige Fragen

Warum kommt bei meinem Text Unsinn heraus?
Meist, weil die Zahlenfolge nach einer anderen Kodierung entstanden ist — etwa Latin-1, wo ein Umlaut ein einzelnes Byte belegt. Dieselbe Bytefolge ergibt je nach Kodierung einen anderen Text; deshalb muss sie mitgeliefert werden, sonst ist die Datei mehrdeutig.
Was ist der Unterschied zwischen Codepunkt und Byte?
Der Codepunkt ist die Nummer eines Zeichens im Unicode-Verzeichnis, etwa U+00E4 für ä. Das Byte ist, was davon nach der Kodierung im Speicher steht — bei UTF-8 für dieses Zeichen zwei Bytes, C3 und A4. Die Zahlen sind verschieden, und beide sind richtig.
Kann ich damit Binärdateien ansehen?
Nur bedingt. Bilder und Programme enthalten Bytefolgen, die keinem gültigen Text entsprechen; die Rückwandlung ergibt dann Ersatzzeichen. Für echte Binärdateien braucht es einen Hex-Editor, der die Bytes gar nicht erst als Text zu deuten versucht.

Quellen

Stand der Werte: 2026. Die Ergebnisse sind Orientierungswerte und ersetzen keine Steuerberatung.

Passt dazu