Saltar al contenido

Visor de bytes UTF-8

Pegue un texto para ver cuántos bytes ocupa cada carácter y cuáles son, en UTF-8 o, si prefiere, en UTF-16 y UTF-32.

Procesado localmente en tu navegador

Opciones
0 caracteres · 0 líneas
El resultado aparecerá aquí.

¿Qué es Visor de bytes UTF-8?

UTF-8 guarda cada punto de código Unicode en uno a cuatro bytes: el ASCII usa uno, las letras latinas con tilde, griegas, cirílicas, hebreas y árabes usan dos, la mayor parte del resto del plano multilingüe básico (incluidos € y CJK) usa tres, y los emoji usan cuatro. El primer byte indica la longitud de la secuencia; los siguientes siempre empiezan por los bits 10.

Este visor lista una fila por punto de código o por carácter visible, con su número de bytes, los bytes en hex, binario y decimal y el patrón de bits UTF-8 que ocupa. Un resumen da el total de bytes, la media por carácter, si el texto es solo ASCII y su tamaño en UTF-8, UTF-16 y UTF-32. Puede cambiar a UTF-16 o UTF-32 en ambos órdenes de bytes y anteponer un BOM.

¿Cómo funciona?

  1. Escriba o pegue su texto: la tabla y el flujo de bytes se actualizan al instante.
  2. Elija la codificación (UTF-8 por defecto) y si cada fila es un punto de código o un grafema.
  3. Elija el formato del flujo de bytes (hex, binario, decimal u octal) y active el BOM si lo necesita.
  4. Consulte el resumen para el tamaño total y copie el flujo de bytes.

Casos de uso habituales

  • Entender por qué una cadena ocupa más bytes que caracteres cuando choca con una columna de base de datos o el límite de una API.
  • Comprobar los bytes exactos de un carácter no ASCII antes de escribir un caso de prueba o un mensaje de protocolo binario.
  • Comprender el mojibake: ver que é es C3 A9 en UTF-8 y por eso aparece como é si se lee como Latin-1.
  • Comparar el espacio que ocupa el mismo texto en UTF-8, UTF-16 y UTF-32.

Ejemplos

Prueba esta entrada en la herramienta de arriba:

Entrada
Héllo €😀
Salida
48 C3 A9 6C 6C 6F 20 E2 82 AC F0 9F 98 80

Privacidad

Visor de bytes UTF-8 se ejecuta por completo en tu navegador. El texto o los archivos que proporcionas se procesan en tu dispositivo y no se suben, registran ni almacenan en nuestros servidores.

Limitaciones

La herramienta muestra cómo se codifica un texto, no el contenido de un archivo en disco: para eso use un visor hexadecimal. Los sustitutos aislados no se pueden codificar en UTF-8 ni UTF-32 y se muestran como U+FFFD. Solo se analizan los primeros 100 000 caracteres.

Preguntas frecuentes

¿Cuántos bytes ocupa un emoji en UTF-8?

Casi siempre cuatro, porque los emoji están por encima de U+FFFF. Una secuencia como el emoji de familia une varios emoji con unidores de ancho cero (3 bytes cada uno) y puede llegar a 18 bytes o más.

¿En qué se diferencia del Inspector Unicode?

El inspector describe caracteres: categoría, escritura, entidad HTML. Esta herramienta se centra en los bytes: tamaños, patrones de bits, varias codificaciones, orden de bytes y BOM.

¿Por qué UTF-16 y UTF-32 muestran otros bytes para el mismo texto?

UTF-16 usa dos o cuatro bytes y UTF-32 siempre cuatro; ambos dependen del orden de bytes (little o big endian). UTF-8 no tiene ese problema, una de las razones de su dominio en la web.

Más herramientas en Codificación y decodificación →