UTF-8

Encoding & Standards

Codificação Unicode de largura variável que usa de 1 a 4 bytes por caractere, dominante na web (usada por mais de 98% dos sites).

UTF-8 is the most widely used Unicode encoding. ASCII characters (U+0000 to U+007F) use 1 byte, making it backward-compatible with ASCII. Characters beyond ASCII use 2-4 bytes.

Most emoji require 4 bytes in UTF-8 because they live in the Supplementary Multilingual Plane (code points above U+FFFF). For example, 😀 (U+1F600) encodes as 0xF0 0x9F 0x98 0x80.

UTF-8's dominance on the web (recommended by W3C, used by HTML5 by default) makes it the standard choice for storing and transmitting emoji in most applications.

Termos relacionados

BOM (BOM) BOM (BOM)
A Marca de Ordem de Byte (U+FEFF) colocada no início de um arquivo de texto para indicar a ordem dos bytes (endianness) nas codificações UTF-16/UTF-32.
Unidade de código Unidade de código
A combinação mínima de bits usada para codificar um caractere: 8 bits para UTF-8, 16 bits para UTF-16 e 32 bits para UTF-32.
UTF-16 UTF-16
Codificação Unicode de largura variável que usa 2 ou 4 bytes por caractere, usada internamente por JavaScript, Java e Windows.
UTF-32 UTF-32
Codificação Unicode de largura fixa que usa exatamente 4 bytes por caractere, permitindo mapeamento direto de pontos de código ao custo de mais espaço.

Ferramentas relacionadas

🔢 Consulta Unicode Consulta Unicode
Digite um codepoint como U+1F600 e obtenha o emoji, detalhes de codificação, bytes UTF-8/16 e entidades HTML.