Unicode-Zeichenprüfer

Jedes Zeichen mit Codepunkt, Bytes — und den unsichtbaren Fallen.

12 Codepunkte in 15 Bytes.

Zeichen einzeln
G U+0047 — Großbuchstabe, UTF-8 47, G r U+0072 — Kleinbuchstabe, UTF-8 72, r ö U+00F6 — Kleinbuchstabe, UTF-8 C3 B6, ö ß U+00DF — Eszett, UTF-8 C3 9F, ß e U+0065 — Kleinbuchstabe, UTF-8 65, e : U+003A — Satzzeichen, UTF-8 3A, : U+0020 — Leerzeichen, UTF-8 20,   3 U+0033 — Ziffer, UTF-8 33, 3 0 U+0030 — Ziffer, UTF-8 30, 0 U+0020 — Leerzeichen, UTF-8 20,   ° U+00B0 — Gradzeichen, UTF-8 C2 B0, ° C U+0043 — Großbuchstabe, UTF-8 43, C
Unsichtbare Zeichen
keine — im Text steht kein unsichtbares Zeichen
Normalform
NFC — die Zeichen sind bereits zusammengezogen
Größe in Bytes
15 Bytes in UTF-8, 12 Codepunkte, 12 UTF-16-Einheiten
Hinweis
Codepunkte und UTF-16-Einheiten stimmen überein: Der Text enthält keine Zeichen jenseits der Grundebene.

Zwei Texte können auf dem Bildschirm gleich aussehen und für jeden Vergleich verschieden sein. Ein ä kann ein einzelnes Zeichen sein oder ein a mit nachgestelltem Trema, ein Leerzeichen ein gewöhnliches oder ein geschütztes, ein Bindestrich ein Minus oder ein Halbgeviertstrich.

Der Prüfer zerlegt den Text in seine Codepunkte und nennt zu jedem die Nummer, die UTF-8-Bytes und die HTML-Entität. Unsichtbare und leicht zu verwechselnde Zeichen werden gesondert gemeldet.

Zerlegte Umlaute

macOS speichert Dateinamen zerlegt: Das ä in „Größe“ steht dort als a gefolgt von einem kombinierenden Trema, also als zwei Codepunkte. Auf dem Bildschirm ist kein Unterschied zu sehen, in jedem Vergleich, jeder Suche und jeder Sortierung dagegen schon.

Die Lösung heißt Normalisierung: In der Form NFC werden solche Folgen wieder zu einem Zeichen zusammengezogen. Der Rechner meldet, ob der Text bereits in NFC vorliegt — steht dort nein, ist genau das die Ursache für scheinbar unerklärliche Vergleichsfehler.

Zeichen, die man nicht sieht

Das geschützte Leerzeichen U+00A0 kommt beim Kopieren aus dem Browser mit und verhindert dort einen Umbruch — in einer CSV-Datei macht es aus einer Zahl einen Text. Der bedingte Trennstrich U+00AD ist unsichtbar, bis das Wort umbrochen wird, und zerreißt jede Suche.

Dazu kommen die Steuerzeichen für die Schreibrichtung und die Byte-Reihenfolge-Marke U+FEFF, die am Anfang einer Datei steht und beim Einlesen als seltsames Zeichen auftaucht. Alle drei melden sich hier mit Namen und Position.

Häufige Fragen

Warum ist mein Text länger als er aussieht?
Weil Zeichen jenseits der Grundebene — die meisten Emojis — in JavaScript und vielen Datenbanken als zwei Einheiten zählen, und weil kombinierende Zeichen eigene Codepunkte sind. Der Rechner zeigt beide Zahlen getrennt.
Was ist der Unterschied zwischen ° und º?
Das erste ist das Gradzeichen U+00B0, das zweite der männliche Ordnungsindikator U+00BA aus dem Spanischen und Portugiesischen. Sie sehen fast gleich aus, und in Messwerten steht regelmäßig das falsche.

Quellen

Stand der Werte: 2026. Die Ergebnisse sind Orientierungswerte und ersetzen keine Steuerberatung.

Passt dazu