Text, Zeichen und Bytes unterscheiden
Computer speichern Text nicht als sichtbare Buchstaben, sondern als Bytes. UTF-8 ordnet jedem Unicode-Codepunkt eine Folge von einem bis vier Bytes zu. ASCII-Zeichen benötigen ein Byte, viele europäische Zeichen zwei, CJK-Zeichen meist drei und viele Emoji vier Bytes.
Hexadezimal schreibt jedes Byte mit genau zwei Ziffern von 00 bis FF. Dadurch ist eine UTF-8-Folge kompakt und bytegenau lesbar. „A“ wird zu 41, während „ä“ zu C3 A4 wird; die Anzahl sichtbarer Zeichen und die Anzahl Bytes können also verschieden sein.
So verwendest du den Konverter
Wähle zuerst die Richtung und gib anschließend Text oder vollständige Bytepaare ein.
- Wähle Text zu Hex oder Hex zu Text.
- Füge den Inhalt in das Eingabefeld ein.
- Bei Text zu Hex wähle Groß-/Kleinschreibung und ein Trennzeichen.
- Klicke auf Konvertieren; Ergebnis und Zähler erscheinen darunter.
- Kopiere das Ergebnis oder prüfe es durch eine Rückkonvertierung.
Typische Beispiele
Die Beispiele zeigen Ein- und Mehrbytezeichen sowie unsichtbare Steuerbytes.
| Eingabe | Ausgabe | Hinweis |
|---|---|---|
| Hello | 48 65 6c 6c 6f | ASCII-Zeichen belegen je ein Byte. |
| Grüße | 47 72 c3 bc c3 9f 65 | ü und ß verwenden je zwei UTF-8-Bytes. |
| 你好 | e4 bd a0 e5 a5 bd | Jedes chinesische Zeichen benötigt drei Bytes. |
| 👋 | f0 9f 91 8b | Dieses Emoji ist eine Vierbytefolge. |
| 00 41 0A | NUL, A, Zeilenumbruch | Dekodierte Bytes können Steuerzeichen enthalten, die im Ausgabefeld nicht sichtbar gerendert werden. |
| c3 28 | Fehler | C3 beginnt eine Mehrbytesequenz, aber 28 ist kein gültiges Folgebyte; die strikte Dekodierung weist sie zurück. |
Zulässige Eingaben
Im Textmodus wird jede JavaScript-Zeichenfolge mit TextEncoder als UTF-8 kodiert. Zeilenumbrüche, Tabulatoren und Leerzeichen bleiben erhalten. Es findet keine Unicode-Normalisierung statt, daher können optisch gleiche Zeichen unterschiedliche Bytes besitzen.
Im Hexmodus sind Ziffern 0–9 und A–F erlaubt. Leerzeichen, Doppelpunkte, Bindestriche, Unterstriche und optionale 0x-Präfixe dienen als Trennung. Nach dem Entfernen der Trennzeichen muss eine gerade Anzahl Hexziffern verbleiben.
- Jedes Byte benötigt genau zwei Hexziffern.
- Groß- und Kleinschreibung sind bei der Eingabe gleichwertig.
- Leere Eingabe wird als Fehler behandelt.
- Die Dekodierung erwartet ausschließlich UTF-8.
So funktioniert die Umwandlung
TextEncoder erzeugt die UTF-8-Bytefolge. Jedes Byte wird in Basis 16 formatiert, auf zwei Stellen aufgefüllt und mit dem gewählten Trennzeichen verbunden.
Beim Dekodieren werden erlaubte Trennzeichen entfernt, Zeichen und Paarlänge geprüft und jedes Paar in ein Byte umgewandelt. TextDecoder läuft im fatalen Modus und weist ungültiges UTF-8 zurück.
Die Anwendung errät keine alternative Zeichenkodierung wie UTF-16, Latin-1, Windows-1252 oder GBK. Diese feste Entscheidung verhindert mehrdeutige Ergebnisse.
Praktische Einsatzfälle
Hex ist nützlich, wenn Systeme Bytes statt lesbarem Text anzeigen.
API-Fehlersuche
Prüfe Leerzeichen, Zeilenumbrüche, Unicode-Namen und Emoji in Payloads.
Dateien untersuchen
Vergleiche UTF-8-Ausschnitte aus Binärdateien, Exporten und Dumps.
Testvektoren erstellen
Erzeuge Bytearrays und feste Beispiele für Protokolle und Parser.
Unicode erklären
Stelle sichtbare Zeichen, Codepunkte und UTF-8-Bytes gegenüber.
Häufige Fehler und Grenzen
Die meisten Probleme entstehen durch unvollständige Bytepaare oder eine andere Zeichenkodierung.
Ungerade Ziffernanzahl
Ein Byte braucht zwei Ziffern; ergänze die fehlende führende Null oder das fehlende Halbbyte.
Falsche Kodierung
Bytes aus UTF-16, Latin-1, Windows-1252 oder GBK müssen nicht gültiges UTF-8 sein.
Unsichtbare Zeichen
NUL, Tabulator und Zeilenumbruch können korrekt dekodiert sein, ohne sichtbar zu erscheinen.
Optisch gleicher Text
Unterschiedliche Unicode-Normalformen können gleich aussehen und dennoch andere Bytes erzeugen.
Abgrenzung zu verwandten Werkzeugen
Die passende Wahl hängt davon ab, ob du Bytes, Zahlen oder für den Transport kodierten Text untersuchst.
Text zu Binär
Zeigt dieselben UTF-8-Bytes als Achtbitgruppen; Hex ist kürzer.
ASCII-Tabelle
Deckt nur die ersten 128 Codes ab, nicht vollständige UTF-8-Folgen.
Base64
Ist für Transport kompakt; Hex ist bei Byteinspektion leichter zu lesen.
Zahlensystem-Konverter
Behandelt die Eingabe als eine Zahl; hier bleibt die Reihenfolge einzelner Bytes erhalten.