Significado de Codificación de caracteres
Sustantivo femenino compuesto. De codificar, del francés codifier, y carácter, del latín character.
La codificación de caracteres es el conjunto de reglas que asigna un número concreto a cada letra, símbolo o signo de un idioma, para que un ordenador pueda almacenarlo y transmitirlo en formato binario.
Sin una codificación compartida entre quien escribe y quien lee un texto digital, los mismos números se interpretarían como letras distintas, y el resultado sería un texto ilegible.
Qué es la codificación de caracteres
Un ordenador solo almacena números, nunca letras directamente. La codificación de caracteres resuelve ese problema estableciendo una tabla fija: a cada carácter le corresponde un número concreto, y a cada número, un patrón de bits. Cuando un programa muestra un texto, traduce esos números de vuelta a las letras que representan, según la tabla que esté usando.
El problema aparece cuando el programa que escribe un texto usa una tabla distinta de la que usa el programa que lo lee: el mismo número se interpreta como un carácter diferente, y aparecen los símbolos extraños típicos de un archivo «mal codificado». Por eso especificar la codificación —dentro del propio archivo o en la comunicación entre programas— es una parte obligatoria de cualquier formato de texto digital.
La codificación de caracteres la definen organismos de estandarización internacionales, y la aplican a diario los sistemas operativos, los navegadores, los editores de texto y cualquier programa que lea o escriba texto.
Origen de la palabra codificación de caracteres
De codificar, «transformar mediante las reglas de un código», del francés codifier, y carácter, del latín character y este del griego charaktér, «signo grabado».
Las primeras codificaciones, pensadas para el telégrafo y los primeros ordenadores, cubrían solo el alfabeto inglés y unos pocos signos, lo que bastaba para sus usuarios pero dejaba fuera tildes, eñes y alfabetos no latinos. La necesidad de representar todos los idiomas del mundo en un mismo sistema informático llevó, ya en las últimas décadas del siglo XX, a codificaciones capaces de cubrir prácticamente cualquier símbolo escrito por la humanidad.
Tipos de codificación de caracteres
| Codificación | En qué consiste |
|---|---|
| ASCII | Cubre 128 caracteres: letras sin tilde del alfabeto inglés, dígitos y signos básicos. |
| ISO 8859 (Latin-1 y variantes) | Amplía ASCII para incluir tildes, eñes y otros signos de lenguas europeas. |
| UTF-8 | Representa cualquier carácter de cualquier idioma; es compatible con ASCII y es la más usada en internet. |
| UTF-16 | Otra forma de representar el mismo repertorio universal, usada sobre todo en ciertos sistemas y lenguajes de programación. |
Ejemplos de uso de codificación de caracteres
Al abrir el archivo con la codificación equivocada, las eñes y las tildes aparecían convertidas en símbolos extraños.
La página web declara su codificación de caracteres en el propio código para que el navegador la muestre bien.
El programador cambió la codificación de caracteres del archivo de ASCII a UTF-8 para poder guardar textos en varios idiomas.
El correo llegó con la codificación de caracteres corrupta y el destinatario no pudo leer el mensaje original.
Casi todos los sitios web actuales usan la misma codificación de caracteres, lo que reduce los problemas de compatibilidad entre sistemas.
Sinónimos y palabras relacionadas
Sinónimos: juego de caracteres, tabla de codificación (en un sentido próximo).
Antónimos: no tiene antónimo propio.
No es lo mismo que:
- Unicode: es el estándar que asigna un número único a cada carácter posible; UTF-8 es una de las formas concretas de codificar en binario esos números de Unicode. Ver significado de Unicode.
- Cifrado: el cifrado oculta un contenido para que solo quien tenga la clave pueda leerlo; la codificación de caracteres no oculta nada, solo traduce letras a números de forma pública y reversible.
- Formato de archivo: el formato define la estructura general de un archivo; la codificación de caracteres se ocupa solo de cómo se representa el texto dentro de él.
Preguntas frecuentes sobre la codificación de caracteres
¿Por qué aparecen símbolos raros al abrir algunos archivos de texto?
Porque el programa que abre el archivo usa una codificación de caracteres distinta de la que se usó para guardarlo, así que interpreta los mismos números como letras diferentes a las originales.
¿Qué diferencia hay entre ASCII y UTF-8?
ASCII solo cubre 128 caracteres del alfabeto inglés y algunos signos básicos; UTF-8 cubre prácticamente cualquier carácter de cualquier idioma y, además, es compatible con ASCII para ese conjunto reducido de símbolos.
¿Por qué UTF-8 se ha vuelto tan habitual?
Porque resuelve el problema de fondo —representar cualquier idioma— sin ocupar más espacio del necesario para los textos en alfabeto latino, y por eso se ha convertido en la codificación por defecto de la mayoría de sitios web y programas.