Saltar al contenido

Inspector de Caracteres Unicode

Pegue un texto o un emoji y vea exactamente de qué puntos de código, bytes y escrituras se compone.

Procesado localmente en tu navegador

Opciones
0 caracteres · 0 líneas
El resultado aparecerá aquí.

¿Qué es Inspector de Caracteres Unicode?

Unicode asigna a cada carácter un número, su punto de código, y las codificaciones lo almacenan de forma distinta: UTF-8 usa de 1 a 4 bytes, UTF-16 una o dos unidades de 16 bits. Conocer los puntos de código exactos explica fallos misteriosos: espacios invisibles de ancho cero, letras cirílicas parecidas a las latinas, acentos formados por marcas combinantes o un emoji de familia que en realidad son cinco puntos de código.

Este inspector funciona como inspector de caracteres, visor de puntos de código de emoji y visor de bytes UTF-8 a la vez. Para cada punto de código (o, si lo prefiere, cada grafema visible, con Intl.Segmenter cuando su navegador lo ofrece) muestra el carácter, el punto de código U+, el valor decimal, los bytes UTF-8, las unidades UTF-16, la entidad HTML, la categoría general (Lu, Ll, So, Cf…) y la escritura (Latin, Han, Cyrillic, Common…). Un resumen cuenta caracteres, puntos de código, unidades UTF-16 y bytes UTF-8 e indica si el texto es solo ASCII o está en forma NFC.

¿Cómo funciona?

  1. Pegue o escriba cualquier texto, emoji o cadena sospechosa.
  2. Elija una fila por punto de código (por defecto) o por grafema (carácter visible).
  3. Lea la tabla (primeros 500 elementos) y el resumen; los caracteres de control e invisibles se muestran con símbolos visibles.

Casos de uso habituales

  • Encontrar caracteres invisibles como el espacio de ancho cero (U+200B) o una marca de orden de bytes en texto copiado.
  • Entender por qué dos cadenas idénticas a la vista no coinciden (letras parecidas o distinta normalización).
  • Aprender cómo se construyen las secuencias de emoji con varios puntos de código y uniones.
  • Calcular la longitud en bytes UTF-8 de un texto para una columna de base de datos o un límite de API.

Ejemplos

Prueba esta entrada en la herramienta de arriba:

Entrada
Héllo 👨‍👩‍👧 世界
Salida
U+0048 U+00E9 U+006C U+006C U+006F U+0020 U+1F468 U+200D U+1F469 U+200D U+1F467 U+0020 U+4E16 U+754C

Privacidad

Inspector de Caracteres Unicode se ejecuta por completo en tu navegador. El texto o los archivos que proporcionas se procesan en tu dispositivo y no se suben, registran ni almacenan en nuestros servidores.

Limitaciones

No se incluyen nombres de caracteres y las escrituras cubren los sistemas más comunes (las demás aparecen como "Other"). El análisis se detiene tras 200 000 caracteres y la tabla muestra 500 filas.

Preguntas frecuentes

¿Qué diferencia hay entre punto de código y grafema?

Un punto de código es un número Unicode. Un grafema es lo que ve como un carácter; puede constar de varios puntos de código, como "e" más un acento combinante o una bandera formada por dos indicadores regionales.

¿Por qué 😀 tiene dos unidades UTF-16?

Las unidades UTF-16 son de 16 bits, así que por encima de U+FFFF un punto de código se guarda como par sustituto (D83D DE00). En UTF-8 el mismo carácter ocupa cuatro bytes: F0 9F 98 80.

¿Qué significan categoría y escritura?

La categoría es la categoría general de Unicode (Lu = letra mayúscula, Nd = dígito decimal, Cf = carácter de formato invisible…). La escritura indica a qué sistema de escritura pertenece el carácter; la puntuación y los emoji suelen ser "Common".

Más herramientas en Codificación y decodificación →