Contador de palabras
Contar palabras, caracteres y tiempo de lectura.
Texto
Generar y detectar caracteres invisibles.
Unicode incluye varios caracteres sin representación visible, y cada uno tiene su función.
| Carácter | Función |
|---|---|
| Espacio de no separación | impide un salto de línea |
| Espacio fino | separación tipográfica más precisa |
| Espacio de ancho cero | permite cortar sin dejar hueco |
| Guion opcional | punto de división solo si hace falta |
| Unión de ancho cero | controla la unión de caracteres |
En español el espacio de no separación es el más útil. Va entre número y unidad —5 kg, 20 °C—, entre las iniciales y el apellido, y en abreviaturas como "pág. 12" que no deben partirse.
También conviene en las cifras: en español el separador de miles es el punto y el decimal la coma, y en textos técnicos se recomienda un espacio fino como separador de miles. Ese espacio no debe permitir un corte de línea.
El guion opcional es útil con palabras largas: lo colocas en los puntos donde la división es correcta y el navegador solo parte si lo necesita.
Y es un buen momento para recordar que en español la división de palabras sigue reglas silábicas propias, así que la partición automática del navegador no siempre acierta si no le indicas el idioma.
Este es el motivo por el que conviene poder detectarlos.
Al copiar de Word, de un PDF o de una web arrastras caracteres invisibles con frecuencia.
En campos de formulario provocan que un correo electrónico, un DNI o un código de descuento "evidentemente correcto" sea rechazado.
En hojas de cálculo hacen que dos valores aparentemente idénticos no se reconozcan como iguales, y una búsqueda no encuentre lo que está ahí delante.
En código son especialmente molestos, porque el compilador da un error que no tiene nada que ver con el problema real.
Y en bases de datos entran sin ruido en los registros y aparecen después, al cruzar datos, como discrepancias.
Así que si algo "debería funcionar" y no funciona, mirar si hay caracteres invisibles es de las primeras cosas que compensa comprobar.
Algunas cosas que conviene saber.
Se usan caracteres invisibles para saltarse filtros, por ejemplo escribiendo una palabra bloqueada con un espacio de ancho cero en medio.
También para marcar documentos: quien distribuye un documento confidencial a varios destinatarios puede darle a cada uno una firma invisible y averiguar en caso de filtración qué copia se difundió. Es técnicamente posible y jurídicamente delicado, tanto en el ámbito laboral como en protección de datos.
Un principio parecido funciona con los homoglifos —letras cirílicas que se parecen a las latinas— en dominios de phishing. No son caracteres invisibles, pero el mecanismo es el mismo.
La conclusión práctica: si procesas entradas de usuarios, normalízalas. Aplica normalización Unicode, elimina caracteres de control invisibles, y solo después compara o guarda.
Y en contraseñas no tienen ningún sentido: aportan casi nada en seguridad y algún día te impedirán volver a introducirla.
Todo funciona en tu navegador.
Para impedir cortes de línea, por ejemplo en "5 kg" o entre iniciales y apellido.
Un punto de división válido que solo se hace visible si hay que partir la palabra.
Suele haber caracteres invisibles arrastrados al copiar de Word o de un PDF.
Técnicamente sí, y es delicado tanto laboral como jurídicamente.
Normalizarlas y quitar los caracteres de control antes de comparar o guardar.
No.