跳到主要內容

Unicode, UTF-8, UTF-16, UCS-2 和一些程式語言的支援方式

讀 JavaScript 書時, 忽然想到 Unicode 支援問題, 就複習了一下相關知識。有錯還請指正。

什麼是 Unicode? 什麼是 UTF-X?

  • Unicode: 將全部語言用的字集統整成一張表。定義每個文字對應的數字, 像是 'a' 對應到 97,  '我' 對應到 25105。整張表含蓋的字集範圍介於 0 ~ 1114111 (0x10FFFF) 之間。
  • UTF-X: X bits Unicode Transformation Format。有了 Unicode 這張表, 再來就是定義怎麼儲存這張表。

UTF-8、UTF-16 和 UCS-2

  • UTF-32: 原封不動地把 Unicode 表裡的每個數字用 4 bytes 表示。相當浪費空間。
  • UTF-8: 可以想成某種資料壓縮方式。使得常用的 ASCII 字元仍用 1 byte 表示, 中文、日文、韓文等象型文字用 3 bytes 表示, 比原本各國自己用的表示方法多 1 byte (如日文的 Shift-JIS、簡體中文 GB 和繁體中文 Big5)。文字處理軟體 (如記事本、瀏覽器) 得「解壓縮」這種文字編碼方式, 還原回 Unicode 裡定義的數字, 才知道它是那個字。
  • UTF-16: 0 ~ 65535 的字用 2 bytes 表示, 之後的用 4 bytes 表示。
  • UCS-2: UTF-16 的子集, 只有 2 bytes 的字元組。
Wikipedia 的介紹很清楚地說明 UTF-8、UTF-16 如何動態地用 2 ~ 4 bytes 表示不同範圍的數字。設計的很巧妙, 值得一看。對程式設計師來說, 最棒的是沒有任何字元是其它字元的子字元, 於是字串比對演算法可以直接使用。像 Big5 設計不良, 有名的許功蓋問題, 實在是夢魘啊。

程式如何明白檔案使用的編碼方式?

有了這些編碼方式, 程式得先明白讀到的檔案用什麼編碼才能正常處理。像 HTML 的開頭:
<META HTTP-EQUIV="Content-Type" CONTENT="text/html; charset=utf-8">”
和 Python 程式的開頭:
#-*- coding: utf-8 -*-
都是用來說明編碼方式。

程式語言支援 Unicode 的方式

不同的程式語言, 支援 Unicode 的程度不同, 方式也有差異。所謂「支援」的意思, 就是程式能正確地算出字串長度、索引到正確的字等。

Java 在 J2SE 5 前用 UCS-2, 從J2SE 開始用 UTF-16。JavaScript 似乎用 UCS-2 的樣子。而 Python 另外用了物件 unicode 來表示 Unicode (也是用 UTF-16)。在 Python 裡, 從 UTF-8 格式的檔案內讀入文字後, 文字的型別是 str, 若讀入的文字是中文的話, 它相當於 byte stream, 無法正確地操作字串, 得先轉為 unicode 才行。詳細的說明請見《All About Python and Unicode》, 講得超級清楚, 我之前就是讀這份弄懂的。

留言

這個網誌中的熱門文章

(C/C++ ) 如何在 Linux 上使用自行編譯的第三方函式庫

以使用 LevelDB 為例。 抓好並編好相關檔案,編譯方式見第三方函式庫附的說明:$ ls include/ # header files leveldb/ $ ls out-shared/libleveldb.so* # shared library out-shared/libleveldb.so@ out-shared/libleveldb.so.1@ out-shared/libleveldb.so.1.20* 下面的例子用 clang++ 編譯,這裡用到的參數和 g++ 一樣。 問題一:找不到 header$ clang++ sample.cpp sample.cpp:5:10: fatal error: 'leveldb/db.h' file not found #include "leveldb/db.h" ^ 1 error generated. 解法:用 -I 指定 header 位置 問題二:找不到 shared library$ clang++ sample.cpp -I include/ /tmp/sample-2e7dd8.o: In function `main': sample.cpp:(.text+0x1e): undefined reference to `leveldb::Options::Options()' sample.cpp:(.text+0x6f): undefined reference to `leveldb::DB::Open(leveldb::Options const&, std::string const&, leveldb::DB**)' sample.cpp:(.text+0x10c): undefined reference to `leveldb::Status::ToString() const' sample.cpp:(.text+0x7d0): undefined reference to `leveldb::Status::ToString() const' clang: error: linker command failed with exit code 1 (u…

熟悉系統工具好處多多

記一下以前很困擾, 現在秒殺的小事。 更新這篇的時候, 忘了函式庫用的 man page 裝在那個 package。以前就會想辦法 google, 運氣好一下會找到, 運氣不好會多找一會兒。 這回我想到新作法:$ strace -e open man 3 printf > /dev/null # 發現是讀 /usr/share/man/man3/printf.3.gz $ dpkg --search /usr/share/man/man3/printf.3.gz # 找到套件名稱 manpages-dev $ aptitude show manpages-dev # 確認描述符合, 收工

virtualbox 使用 USB 裝置

2012-12-16 更新 現在 (4.x 版) 似乎無需做任何設定, 只要有裝 Oracle VM VirtualBox Extension Pack, 在 VirtualBox 視窗右下角按 USB 的圖示, 再點目標裝置, 即可加入或移除該裝置 同一時間只有 host 或 guest 可擁有該裝置, 所以從 guest OS 移除, 相當於接回 host OS 目前 VirtualBox 只支援 USB 2.0 的插槽, 若偵測不到時, 注意一下是否為這個問題 有時拔拔插插, VirtualBox 會進入奇怪的狀態, 接上去 guest OS 無法連接且跳出 device is busy 的錯誤訊息。試看看拔除該裝置, 重開 guest OS (續上則) 若重開 guest OS 無效, 並且 host OS 已移除該裝置, VirtualBox 的 USB 清單卻仍顯示 "captured", 試看看拔除該裝置, 重開 host OS原文網路上搜一下, 比較多是 Ubuntu 當 host 的解法, 我的情況是 Win7 當 host, Ubuntu 當 guest。 這兩篇說明很詳細《Learn How to Set Up USB and Networking Options in VirtualBox》《幻影千瞳的部落格: VirtualBox 使用筆記(二):使用 USB 裝置》 現在的版本圖形介面很好用了, 不用像第二篇說的那樣用指令操作。這裡記下我的操作步驟: 關掉 guest OS 在 VirtualBox 選單, 選擇 guest OS -> Settings -> USB -> Enable USB 2.0 會出現訊息框, 說明要安裝 Oracle VM VirtualBox Extension Pack。下載後安裝它 host OS 插入 USB 隨身碟 在 VirtualBox 選單, 選擇 guest OS -> Settings -> USB, 點右邊有綠色 "+" 的 USB 頭的圖示, 選擇該 USB 隨身碟, 加入它的 filter 從 host OS 移除 USB 隨身碟 開啟 guest OS 插入 USB 隨身碟, 於是 guest OS 會自動偵測…