UTF-32

Encoding & Standards

Karakter başına tam olarak 4 bayt kullanan sabit genişlikli Unicode kodlaması; alan kullanımı pahasına doğrudan kod noktası eşlemesi sağlar.

UTF-32 is the simplest Unicode encoding: every character uses exactly 4 bytes, and the value directly corresponds to the code point. This makes random access and character counting trivial.

However, UTF-32 uses 4x the memory of ASCII text and 2x that of UTF-16 for most common characters. It's rarely used for storage or transmission but can be convenient for internal string processing.

Python 3's internal string representation uses a variable-width encoding (Latin-1, UCS-2, or UCS-4) depending on the highest code point in the string, which is why `len('😀')` correctly returns 1.

İlgili Terimler

BOM (BOM) BOM (BOM)
UTF-16/UTF-32 kodlamalarında bayt sırasını (endianness) belirtmek amacıyla metin dosyasının başına yerleştirilen Bayt Sırası İşareti (U+FEFF).
Kod Birimi Kod Birimi
Bir karakteri kodlamak için kullanılan minimum bit kombinasyonu: UTF-8 için 8 bit, UTF-16 için 16 bit ve UTF-32 için 32 bit.
UTF-16 UTF-16
Karakter başına 2 veya 4 bayt kullanan değişken genişlikli Unicode kodlaması; JavaScript, Java ve Windows tarafından dahili olarak kullanılır.
UTF-8 UTF-8
Karakter başına 1 ile 4 bayt kullanan değişken genişlikli Unicode kodlaması; web'de baskın kodlamadır (web sitelerinin %98'inden fazlası tarafından kullanılır).

İlgili Araçlar

🔢 Unicode Arama Unicode Arama
U+1F600 gibi bir kod noktası girin ve emojiyi, kodlama ayrıntılarını, UTF-8/16 baytlarını ve HTML varlıklarını alın.