Unidade de código

Encoding & Standards

A combinação mínima de bits usada para codificar um caractere: 8 bits para UTF-8, 16 bits para UTF-16 e 32 bits para UTF-32.

A code unit is the fundamental building block of a Unicode encoding form. It's important to distinguish code units from code points — a single code point may require multiple code units depending on the encoding.

In UTF-8, a code unit is 8 bits (1 byte). The emoji 😀 requires 4 code units. In UTF-16, a code unit is 16 bits (2 bytes). The same emoji requires 2 code units (a surrogate pair). In UTF-32, it's 1 code unit (4 bytes).

Many programming language string APIs operate on code units rather than code points, which is why string length calculations can be confusing with emoji.

Termos relacionados

Par substituto Par substituto
Duas unidades de código UTF-16 (um substituto alto U+D800–U+DBFF seguido de um substituto baixo U+DC00–U+DFFF) que juntas representam um caractere acima de U+FFFF.
UTF-16 UTF-16
Codificação Unicode de largura variável que usa 2 ou 4 bytes por caractere, usada internamente por JavaScript, Java e Windows.
UTF-32 UTF-32
Codificação Unicode de largura fixa que usa exatamente 4 bytes por caractere, permitindo mapeamento direto de pontos de código ao custo de mais espaço.
UTF-8 UTF-8
Codificação Unicode de largura variável que usa de 1 a 4 bytes por caractere, dominante na web (usada por mais de 98% dos sites).

Ferramentas relacionadas

🔢 Consulta Unicode Consulta Unicode
Digite um codepoint como U+1F600 e obtenha o emoji, detalhes de codificação, bytes UTF-8/16 e entidades HTML.