世界中の文字をコンピュータで扱う「文字コード」の歴史と最新標準。エンコーディングを正確に理解しましょう。
文字化けって、なんで起こるの?
主に文字コードの不一致が原因よ。
文字コードは文字を数値に対応付ける規則で、複数の規格があるの。
歴史順に: ASCII (7ビット・英数字のみ)、JIS (JIS X 0201/0208)、Shift_JIS、EUC-JP、そして現代のUnicode (UTF-8/16/32) ね。
UTF-8 が世界標準なのぉ?
そうよ。
UTF-8は1〜4バイトの可変長で、ASCII互換。
Webの標準で、95%以上のサイトで採用されているの。
日本語の文字は3バイト消費するわ。
UTF-16は2バイトまたは4バイトで、Java、Windows、JavaScript の内部表現で使われているのよ。
BOMでビッグエンディアンとリトルエンディアンを区別するの。
文字化けの典型例は、Shift_JIS で書かれたファイルを UTF-8 として開いてしまったり、UTF-8 を Shift_JIS と判定してしまったりするケースですね。
HTML の <meta charset='UTF-8'> で明示しておけば防げます。
確認クイズ
現代のWebで最も標準的に使われている文字エンコーディングはどれか。
- ASCII
- Shift_JIS
- EUC-JP
- UTF-8
こたえを見る
正解: 4. UTF-8
UTF-8 はUnicodeの1〜4バイト可変長エンコーディングで、ASCIIと互換性があり、Webの95%以上で採用される現代の標準です。