Thursday, August 11, 2005

異體字查詢軟體:Unihan Variant Dictionary

最近根據友人 Joseph Wicentowski 的需求和意見,寫了一個叫做 Unihan Variant Dictionary 的小軟體。它其實就是個異體字字典,使用者可以輸入一個漢字來查到其他收錄於 Unicode 中的變體,但除此之外也能查詢到字義以及在各種東亞語言(包括中、粵、日、韓、越)中的發音。其實在 Mac OS X 內建的字元面板中也提供了類似的異體字查詢功能,不過 Unihan Variant Dictionary 在速度及方便性上有一些優勢,而且它支援系統的「服務」功能,因此使用者在使用其他應用程式時也可立即呼叫並查詢。目前它適用於 Mac OS X 10.2 以上。

這個軟體使用的異體字資料庫是來自 Unicode 組織所維護的 Unihan Database。Unihan 資料庫針對每個漢字收錄了許多資訊,除了異體、字音、字義之外,還有各種系統的文字編碼、倉頡碼、筆畫數、使用頻率、在各種字典中出現的位置、甚至在韻書和語言學著作中的位置等資料。當然在軟體中只納入了與形、音、義有關的資料。不過在編寫軟體的過程中我們了解到 Unihan 的異體字資料其實有許多不足之處,因此我們也加入了日本京都大學安岡孝一先生的異體字表。我們也發現 Mac OS X 的字元面板所提供的「相關字元」其實包含了相當豐富的資料,如果未來能再結合這其中的資料,應該可以提供最詳盡的查詢結果。此外 Joe 發現 Unihan 所用的韓語拼音似乎並非韓國常用的系統,因此在實用性上也許會打點折扣。

這樣的軟體對於學習東亞語言的外國人以及對漢字變異有興趣者應該是有相當用處的。若您有其他的需求或建議也請不吝讓我們知道。

本文同步刊登於符號工作站


Thursday, June 23, 2005

台灣龍捲風的火星台語

台灣龍捲風這部連續劇終於落幕了,這表示台灣戲劇史上的一場災難也終於結束了。這樣的戲劇本身存在著許多荒謬的地方,包括思考過度簡單、劇情荒腔走板、二分式的正邪對立、極度昧於現實、對描述的對象未盡考證之責、用灑狗血的方式爭取收視率、充斥著不宜闔家觀賞的內容、不斷複製其他戲劇出現過的情境和劇情發展、無限期拖戲、片頭片尾淪為打歌場所等,但我會想特別關注的問題,是其中怪異的語言。

不用說,這樣的本土八點檔使用的語言是台語。只是,也許是因為主要的編劇是個香港人,其劇本中的對白顯然原來是國語、或至少以國語為設計的基礎。但是在演員演出時又照本宣科、以僵硬的方式逐字轉換成台語,於是造成劇中人物所說的話極不自然,成為一種怪異的語言。在劇中,處處可見原本不存在於台語口語的詞硬生生地用念漢字的方式讀出,或是在原國語用詞與轉換後台語用詞間存在著太過簡單或太過規則的對應關係。另外比較有趣的,就是劇中存在著一種詭異的 code-switching(也就是國台語夾雜)現象,這顯然是因為有些用詞實在是怎麼樣也很難用台語念出,只好保留為國語,於是就出現了劇中人物在流利地說著台語句子時,突然在某個預料不到的地方轉為國語,又突然轉回台語的特殊情況。

不是說台語不能吸收國語的辭彙,語言接觸後彼此影響是天經地義、且無法由人為的方式來規範的。只是語言間的同義詞往往不是完全對等的,彼此並不能做一對一的轉換,而劇中未能針對台語使用的現實情況及其道地的用法來設計對白,也顯示了該劇想搭本土劇順風車卻未能精緻地呈現語言的問題。所以到最後,原來多樣而豐富且呈現生活智慧的眾多台語詞彙,消失在這場龍捲風中。

只是,這個龍捲風災難結束了,另一場災難可能正隨之而來。

(寫在最後:我想提及劇中一位演員王豪。他是劇中一個能加入許多生動語言材料的表演者。)

本文同步刊登於符號工作站


Monday, May 16, 2005

Tiger也把中文變羅馬字了

在 Mac OS X v10.4 "Tiger" 推出後,我們看到不少中文環境方面的變動和改進。這次想提出來的,是由站友 Ban 發現的中文轉羅馬拼音的功能。

在過去我們曾提到 Mac OS X 10.3 具有將漢字依日語發音轉成羅馬字的功能,但是無法轉成中文拼音。到了 Tiger 則終於出現了轉成中文拼音的功能。只要是以繁體中文介面開機(這可以在系統偏好設定中的「國際設定」中調整),系統即會在特定的情況下,將使用者輸入的中文自動轉為漢語拼音。

例如,到系統偏好設定的「帳號」開一個新帳號,輸入中文帳號名稱並移到下一個欄位,系統即會自動填上名稱的漢語拼音作為簡稱。而若是到系統偏好設定的「共享」裡輸入中文的電腦名稱,也可以看到系統會將名稱轉為拼音以作為內部網路連線的位址名稱,另外打開「終端機」這個工具程式同樣可以看到被轉成拼音的電腦名稱。只是電腦名稱似乎非得全部以中文命名才行,若是中英文夾雜則系統只會保留英文的部分作為羅馬字形式的名稱。

經過測試,這項功能也適用於簡體中文及韓文。以簡體中文介面開機,中文一樣會被轉為漢語拼音。而若以韓文開機,諺文的部份會被轉為羅馬拼音,漢字則無法依韓語發音轉換。

由於簡短形式的帳號名稱以及電腦名稱都只能以英數字的格式被系統辨認,但是 Mac OS X 又想接受使用者輸入自己習慣的語文作為全稱,因此自動地幫使用者產生英數格式的名稱,也算是 Mac OS X 為使用者著想的一種表現。只是,「阿傑仔」的「仔」他拼成了「zi」....。

本文同步刊登於符號工作站


Sunday, April 24, 2005

從一張舊地圖上的地名說起


Courtesy of the University of Texas Libraries, The University of Texas at Austin.

這張遼東半島一帶的地圖出現於 1912 年 Hachette & Company 的 Madrolle's Guide Book 一書。這張圖除了可以顯示當年當地的地理資訊外,也存在著其他有趣的訊息。

這張地圖裡出現的地名來自各種語言,包括漢、滿、英、日、俄等。漢語北方官話的地名最多,像 Fêng-t'ien(奉天,今瀋陽)、Chao-yang(朝陽)、K'ai-p'ing(開平)等等。奉天的另一名稱 Mukden 則是來自滿語。Dairen、Ryo-jun 是大連、旅順的日語發音,大連的另一名稱 Dalny 則是俄語。Port Arthur 指旅順港,改名的可能是俄國人,不過在這裡又被譯成了英文。這些地名顯示這個地區曾經有多種族群、國家牽涉其間。

另外我會特別注意的,是當時使用的中文拼音。從圖上明顯可知該地圖使用了「威妥瑪」式的拼音。威妥瑪拼音一直到前幾年都是在台灣佔有極大優勢的拼音法,不過一般人對於這個拼音有相當的誤解。

第一,有人以為威妥瑪拼音不區分送氣音與不送氣音,所以會把ㄅ與ㄆ(國際音標 p 與 ph)、ㄉ與ㄊ(t 與 th)、ㄗ與ㄘ(ts 與 tsh)等組發音相混,事實上威妥瑪會在所有送氣音之後加上 ' 符號,所以ㄆ拼為 p'、ㄊ 拼為 t'。第二、ㄜ常被拼成 e,例如「承」拼為 cheng、「德」拼為 te,其實威妥瑪拼音除了在舌根音後方之外,ㄜ是拼為有附加符號的 ê。 第三、 ㄩ的音常常被拼成u,例如「元」拼成 yuan,其實威妥瑪拼音是一律拼成附有兩點的 ü。第四、有人以為威妥瑪拼音「基」(ㄐㄧ)與「知」(ㄓ)都拼成 chi 而混淆、「欺」(ㄑㄧ)與「蚩」(ㄔ)都拼成 ch'i 而混淆,其實ㄓ是拼成 chih、 ㄔ是拼成ch'ih,也就是說,ㄓ、ㄔ、ㄕ的韻母(空韻)其實是拼成 ih,和ㄧ拼成 i 有所區別,h 不可省略。

這張地圖在使用威妥瑪拼音時,沒有混淆送氣音與不送氣音,開平拼為 K'ai-p'ing,而非省略送氣符號的 Kai-ping 。另外承德拼為 Ch'êng-tê,而非 Ch'eng-te 或 Ch'eng-teh(似乎有些人會以 eh 代替 ê)。而平泉的「泉」則拼為 ch'üan而非 chuan。顯然這張地圖上該有的附加符號也都有。整體來說,它在威妥瑪拼音的使用上還算嚴謹。

現在的人們基於誤解、偷懶、打字不便等原因常把威妥瑪拼音弄錯,尤其送氣與不送氣音的混淆最為常見。下次我們有機會使用威妥瑪拼音時,不妨多以謹慎的態度來拼寫。看到近百年前的地圖可以正確地印出這些符號,令人感到現代的人往往是不夠謹慎的,而那些無法或極不方便打出這些特殊符號的電腦作業系統,也算是一種荒謬的現代產品吧。

本文同步刊登於符號工作站


Wednesday, March 16, 2005

讓你的網站會說話

網路上有個叫 SitePal 的服務,它可以藉著 Flash 技術提供動態且具人工智慧的動畫虛擬人物,使用者只要把它整合到自己的網站上,就可以讓活靈活現的虛擬人物豐富自己的網站內容。例如,虛擬人物可以與網站參觀者藉由文字來互動並回答問題、甚至可以發出語音做網站導覽等等。而人物的外觀則可以由服務使用者來自行調整。不過這項服務是必須付費的。

我最感到興趣的是他們的語音功能。要讓虛擬人物發出語音,服務使用者除了可以自行錄音並上傳外,也可以直接使用其 text-to-speech 功能,也就是說,使用者想要人物念出什麼內容,只要把內容用打字的方式輸入,人物即會用語音合成的方式把它朗讀出來。這樣一來,就可以讓人物念出不受限制的内容,並輕易地配合自己的網站做變化。而且,其人物的嘴型還會配合所發出的語音做改變。

其實 text-to-speech 的技術對於很多 Mac 使用者來說並不陌生,因為 Mac 的作業系統一直內建有這種功能。過去的系統中除了英文之外,也具有中文(繁、簡體)與墨西哥西班牙文的文字朗讀功能,只是到了 Mac OS 9 和 Mac OS X 時代, 這兩種語言的朗讀功能就銷聲匿跡了。另外較為可惜的是,Mac OS 提供的語音合成品質一直以來似乎未有重大提昇。

相形之下,SitePal 的語音品質就好得多,更接近自然人聲,詞與詞、音節與音節之間的銜接都算是理想得多。而且 SitePal 可以朗讀十三種語文,其中也包括了中文,念起中文來比當初 Mac 上的「小趙」要優秀不少。不過中文的 text-to-speech 還必須處理一字多音以及上聲變調的問題,而要解決這些問題則經常需要一個資料庫來為文章做「斷詞」,SitePal 在這方面似乎還有不足之處。

看到 SitePal,我想到 text-to-speech 其實可以有多樣化的應用方式。

本文同步刊登於符號工作站


Tuesday, January 11, 2005

不完整的藏文?

在 #osxchat blog 網站上,刊出了一篇文章指出有一個新的 Mac OS X 藏文輸入法正在開發中,其中並描述了作者在製作時所遇到的問題,這套輸入法是以「OpenVanilla」為基礎進行開發,它所運用的也是 Unicode 裡提供的藏文字元。此套輸入法的出現對於想在 Mac OS X 上輸入藏文的朋友來說是相當好的消息。

我們除了感謝作者的努力之外,也慶幸 Mac OS X 不但支援 Unicode,而且在簡體中文字體中也加入了藏文字形。但是該篇文章也說到,有的藏文符號和拼字法似乎仍不在 Unicode 的支援之列。例如,當「上加」用的就沒有辦法適當地加在輔音字母上。下面是一個正確添加上加的例子:

從上面的範例中可以看到,rta (意思是「馬」)這個詞是由作為上加的 (r-) 加在 (ta) 這個字母上構成的,但必須省略最後一筆,然後才加在之上(本身的位置也可能也變得較低)。當作上加時可以加在多種字母上,有時對發音沒有影響,有時則會影響輔音送氣與否或造成聲調高低的不同。然而翻開 Unicode 的符號表,卻遍尋不著這種省略最後一筆的ར上加,這的確是相當奇怪的事。

而在網路上有一個 Java 版的藏英辭典,除了可以在 Windows 上執行,也可以在 Mac OS X 中運作。神奇的是這個辭典可以正常顯示這種添加ར上加的字。經對照後,才發現它使用的藏文字體和系統的並不相同,而似乎有自己的一套字體。這樣看來,它可能並未利用作業系統提供的藏文環境,甚至也不是採用 Unicode 作為內部編碼。

所以,現行版本的 Unicode 在藏文處理上似乎還是有不足之處,也許我們只能期待在未來的 Unicode 版本中能提供更完整的藏文符號。


本文同步刊登於符號工作站

Monday, December 13, 2004

浴血戰場中的「中國古代文明」

最近 Macworld 選出了 Unreal Tournament 2004 為 Mac 平台上的年度最佳遊戲。剛好我正是第一人稱射擊遊戲的愛好者,而且也擁有這款遊戲。這套遊戲的優點之一是它有中文界面,不過似乎得升級到新版本才能正常顯示中文。網路上還有更完整的中文化檔案可供下載,只是目前好像只有簡體中文的版本。

遊戲中有許多華麗的場景,有趣的是,其中有一個場景是以東方特色為主的,建築物內還隨處可見中國文字(請參考附圖)。只是這些中國文字有一些詭異的地方。例如,它將「中國古代文明」這個「名詞組」(noun phrase)寫在各個牌子或燈籠上,對我這個懂中文的人來說似乎沒什麼太大的意義。另外,就是燈籠上的文字是左右相反的,「中國古代文明」也只剩前三個字而顯得較無意義。而在牆上的那四個一組的藍色字雖然不太看得懂,但最大的問題是它經常是上下顛倒或左右相反的(圖片中較上方的四個字即與下方的四個字上下顛倒),這些都並不合理。而更怪的是遊戲裡說明這個場景是在「古代的朝鮮」,朝鮮用漢字不奇怪,但到處寫著「中國」兩字就比較怪異了。

這似乎顯示出做這些場景設計的人是不夠懂中文的,因而弄出了一些不盡合理的安排。這些文字的主要功能大概是為了營造出一種東方味道,對設計者來說這些文字裝飾的作用恐怕遠大於字義的表達。這讓我想起 Engrish.com 這個網站。Engrish.com 裡有許多來自世界各地(主要是日本)誤用英文的圖片,而其中許多令人摸不著頭腦的怪異英文之所以產生,常常也是因為文字本身的外型成為設計或裝飾的一部份,至於字義與語法的正確性反而不被仔細看待。 Fred 兄的抓包地帶討論區裡也有一些和台灣有關的類似例子。

不過在遊戲中,玩家們都在忙著置對方於死地,誰還管得了這麼多?

本文同步刊登於符號工作站