UTF-8

Encoding & Standards

Karakter başına 1 ile 4 bayt kullanan değişken genişlikli Unicode kodlaması; web'de baskın kodlamadır (web sitelerinin %98'inden fazlası tarafından kullanılır).

UTF-8 is the most widely used Unicode encoding. ASCII characters (U+0000 to U+007F) use 1 byte, making it backward-compatible with ASCII. Characters beyond ASCII use 2-4 bytes.

Most emoji require 4 bytes in UTF-8 because they live in the Supplementary Multilingual Plane (code points above U+FFFF). For example, 😀 (U+1F600) encodes as 0xF0 0x9F 0x98 0x80.

UTF-8's dominance on the web (recommended by W3C, used by HTML5 by default) makes it the standard choice for storing and transmitting emoji in most applications.

İlgili Terimler

BOM (BOM) BOM (BOM)
UTF-16/UTF-32 kodlamalarında bayt sırasını (endianness) belirtmek amacıyla metin dosyasının başına yerleştirilen Bayt Sırası İşareti (U+FEFF).
Kod Birimi Kod Birimi
Bir karakteri kodlamak için kullanılan minimum bit kombinasyonu: UTF-8 için 8 bit, UTF-16 için 16 bit ve UTF-32 için 32 bit.
UTF-16 UTF-16
Karakter başına 2 veya 4 bayt kullanan değişken genişlikli Unicode kodlaması; JavaScript, Java ve Windows tarafından dahili olarak kullanılır.
UTF-32 UTF-32
Karakter başına tam olarak 4 bayt kullanan sabit genişlikli Unicode kodlaması; alan kullanımı pahasına doğrudan kod noktası eşlemesi sağlar.

İlgili Araçlar

🔢 Unicode Arama Unicode Arama
U+1F600 gibi bir kod noktası girin ve emojiyi, kodlama ayrıntılarını, UTF-8/16 baytlarını ve HTML varlıklarını alın.