Kod Birimi

Encoding & Standards

Bir karakteri kodlamak için kullanılan minimum bit kombinasyonu: UTF-8 için 8 bit, UTF-16 için 16 bit ve UTF-32 için 32 bit.

A code unit is the fundamental building block of a Unicode encoding form. It's important to distinguish code units from code points — a single code point may require multiple code units depending on the encoding.

In UTF-8, a code unit is 8 bits (1 byte). The emoji 😀 requires 4 code units. In UTF-16, a code unit is 16 bits (2 bytes). The same emoji requires 2 code units (a surrogate pair). In UTF-32, it's 1 code unit (4 bytes).

Many programming language string APIs operate on code units rather than code points, which is why string length calculations can be confusing with emoji.

İlgili Terimler

UTF-16 UTF-16
Karakter başına 2 veya 4 bayt kullanan değişken genişlikli Unicode kodlaması; JavaScript, Java ve Windows tarafından dahili olarak kullanılır.
UTF-32 UTF-32
Karakter başına tam olarak 4 bayt kullanan sabit genişlikli Unicode kodlaması; alan kullanımı pahasına doğrudan kod noktası eşlemesi sağlar.
UTF-8 UTF-8
Karakter başına 1 ile 4 bayt kullanan değişken genişlikli Unicode kodlaması; web'de baskın kodlamadır (web sitelerinin %98'inden fazlası tarafından kullanılır).
Vekil Çifti Vekil Çifti
U+FFFF'nin üzerindeki bir karakteri birlikte temsil eden iki UTF-16 kod birimi: yüksek vekil (U+D800–U+DBFF) ve ardından düşük vekil (U+DC00–U+DFFF).

İlgili Araçlar

🔢 Unicode Arama Unicode Arama
U+1F600 gibi bir kod noktası girin ve emojiyi, kodlama ayrıntılarını, UTF-8/16 baytlarını ve HTML varlıklarını alın.