UTF-32

Encoding & Standards

Codificação Unicode de largura fixa que usa exatamente 4 bytes por caractere, permitindo mapeamento direto de pontos de código ao custo de mais espaço.

UTF-32 is the simplest Unicode encoding: every character uses exactly 4 bytes, and the value directly corresponds to the code point. This makes random access and character counting trivial.

However, UTF-32 uses 4x the memory of ASCII text and 2x that of UTF-16 for most common characters. It's rarely used for storage or transmission but can be convenient for internal string processing.

Python 3's internal string representation uses a variable-width encoding (Latin-1, UCS-2, or UCS-4) depending on the highest code point in the string, which is why `len('😀')` correctly returns 1.

Termos relacionados

BOM (BOM) BOM (BOM)
A Marca de Ordem de Byte (U+FEFF) colocada no início de um arquivo de texto para indicar a ordem dos bytes (endianness) nas codificações UTF-16/UTF-32.
Unidade de código Unidade de código
A combinação mínima de bits usada para codificar um caractere: 8 bits para UTF-8, 16 bits para UTF-16 e 32 bits para UTF-32.
UTF-16 UTF-16
Codificação Unicode de largura variável que usa 2 ou 4 bytes por caractere, usada internamente por JavaScript, Java e Windows.
UTF-8 UTF-8
Codificação Unicode de largura variável que usa de 1 a 4 bytes por caractere, dominante na web (usada por mais de 98% dos sites).

Ferramentas relacionadas

🔢 Consulta Unicode Consulta Unicode
Digite um codepoint como U+1F600 e obtenha o emoji, detalhes de codificação, bytes UTF-8/16 e entidades HTML.