Sunday, June 3, 2007

人名拼音中的鼻音尾

台灣有很多人在講話時沒有完全分清楚注音裡的ㄣ與ㄥ這兩個音,尤其是弄不清ㄧㄣ (in) 跟ㄧㄥ (ing) 的分別。有些人會把ㄧㄣ跟ㄧㄥ一律發成ㄧㄣ,有些人會一律發成ㄧㄥ。有一些中文名字的羅馬拼音會把 n 與 ng 搞錯,不知道是不是這種現象的反映。像王建民在美國大聯盟的官方資料裡,姓名的拼音是 Chien-Ming Wang,但是「民」這個字的拼音顯然是 min 才對。

另外注音中聲母直接加ㄥ或ㄣ的組合也常被混淆,比較常見的應該是都念成聲母+ㄣ,例如很多人會把「成」念成 ㄔㄣˊ (chén)。不過一位人類學界前輩臧振華,他用的姓名拼音是 Tsang Cheng-hwa,這倒是把「振」 的 n 拼成了 ng。

另外有點匪夷所思的是導演李安的名字 Ang Lee,照理說「安」應是 an,拼成 ang 不知只是個不小心的錯誤或是有什麼典故。有些漢語的確會把ㄢ跟ㄤ兩者合併成一類,在台灣有時也會聽說有人不容易發好這類的音、或一時不「輪轉」而把其中一種念成另外一種,不過應該還沒有到普遍地完全不區分ㄢ與ㄤ的地步。

歌手王力宏的名字 Leehom 則是個更特別的例子,如果這名字的確是來自「力宏」兩字的發音的話,那原應以 ng 結尾的「宏」會變成以 m 結尾,實在另人想不透。

當然這些拼音只要是本人固定使用的形式,別人就得照樣引用,畢竟這是他們自己的名字,拼音上的對錯倒成其次,不過其中也許透露出了一些有趣的語言現象。

本文同步刊登於符號工作站

Tuesday, May 8, 2007

談成語(下)

前面我們以語言學上 idiom 概念來檢驗中文的成語,不過事實上語言學的 idiom 與中文裡所說的成語恐怕還是有些差異,畢竟一個是學術名詞,一個則是約定俗成的名詞。中文的「成語」有一個特別的地方是,它們幾乎都是由四個字組成的,成語典收錄的童話故事和電影名稱有一些卻不是四個字,那麼非四字的組合可以算成語嗎?

就語言學的角度來看,不同音節數(在中文即為字數)的 idiom 並沒有各自在語言法則上有不同的表現,也就是三個字、四個字、或五個字的分別並未形成不同的有意義的類別,所以音節數自然不會成為判斷 idiom 成立與否的準備了。如果用這個角度來看,許多非四字的用語是可以被納入成語之中的。

可是如前所述,中文裡所說的成語並不是一個具有精確學術定義的概念,所以情況也可能不太一樣。我們可以看看教育部的成語典如何處理這個問題。只要在成語典裡搜尋一下,就可以在搜尋結果中發現許多超過四個字的「成語」,例如「山不轉路轉」、「畫虎不成反類犬」等等,甚至也有三字的成語,例如「東道主」。只是一方面這些非四字的成語還是少數,另一方面,這些非四字成語似乎大多被放在附錄而非一般成語,所以四字成語的傾向應該還是存在於成語典的。

雖然如前所述,成語的字數在語言學上沒有意義,但是「成語就該是四個字」的想法也不一定就不值一探。漢語既然有豐富的單音節語位,也就有條件把成語組成四個字的單位,在四字成語佔大多數的情況下,就形成了一種不可忽略的模式。而且超過四個字的用語有可能因為表達比較豐富或較為白話,而讓人更注意到其字面本身的意義,其用法也就不是那麼「成語」了。

另外,想在這裡提一下的是成語典的另一個問題:整個系統的設計。成語典主編者說他們並未將那些有爭議的部份當成成語,而且也很快地把它們移到了「參考語料」之中。如果我們相信主編者的說法,也就是相信他們原本就認定「三隻小豬」是附錄性質而非真正的成語的話,那麼成語典所出的問題顯然就是在前端的設計上。在建構資料庫與網頁介面時,操刀的人可能便宜行事,使得成語與參考語料的呈現方式沒有分別,等到鬧出事情後主事者才想者亡羊補牢,卻已經不可收拾了。看看成語典混亂而不易使用的介面,就不難想像它設計上的問題會如何減損它內容的價值。

我想「三隻小豬」的收錄除了爭議那一面之外,應該還是有其正面意義的,它代表成語典忠實地反映與記錄了這個時代的語言,只是提供的方式應該是要再精緻一些了。

寫在最後:成語典把「楚門的世界」原名寫成 The Trueman Show,第二個詞對照該電影的官方原文 Truman 多了一個 e,恐怕還是完全按照原文來寫會比較好。

本文同步刊登於符號工作站

Saturday, April 7, 2007

Unihan Variant Dictionary 1.2.0

異體字查詢軟體 Unihan Variant Dictionary 在上次改版為 Universal Binary 版本後,在 Intel Mac 上出現了一些問題,現在我們已經把它改正,遇到問題的朋友可以下載新的 1.2.0 版。

之前的 Universal 版本之所以在 Intel 機器上會出問題,是 PowerPC 與 Intel 處理器的位元排列順序不同所致。過去的 Mac OS X 在 PowerPC 上運作,採用的是 big-endian,但到了 Intel 處理器上,就變成 little-endian, 例如,一個號碼 0A0B 的字元,若是由 0A 與 0B 兩個位元組成,big-endian 的排列是 0A0B,little-endian 的排列卻是 0B0A。我們在 Unihan Variant Dictionary 1.2.0 中特別處理了這個問題,所以現在不論用哪個平台都可以查詢到正確的結果。

另外,對於 Unicode 碼五位數以上的字元,現在也做了比較好的處理。例如圖中的兩個「形」字 ,上面那個 Unicode 碼是 2F899 ,下面的是一般常見的 5F62 ,你看出不同在哪裡了嗎?

本文同步刊登於符號工作站

Saturday, March 31, 2007

談成語(中)

教育部長說,成語會使人「思想懶惰」、「一知半解」,「成語一旦脫離情境,就會沒有意義」,「如果成語故事大家不熟悉,寫出來的成語、用出來的典故,就和生活以及要表達的感情無關或很淡泊」。我們在此也針對相關的問題來討論討論。

關於「思想懶惰」這件事,有的慣用語似乎是有可能將事情過度簡化。例如有些人聽到小道消息,大部份情況下會選擇相信,而理由呢?常常就是五個字:「無風不起浪」。其實傳言只要未經證實,當然都有某種機率是假的,但一句「無風不起浪」似乎就讓真偽之辨的討論空間變得很小了。

可是如果說成語的典故對現代人都沒意義、運用成語就得了解典故,所以使用成語是不好的,就有些不太對勁的地方了。其實,一般人能使用或理解成語,並不以了解典故為必要條件。如上篇文章所說,成語是以兩個以上詞為一個單位而被直接賦予意義,所以就像許多的詞一樣,它作為一個語意承載單位,有一個約定俗成的意義,說話者可以直接將成語與其語意連結起來,不一定要經過背後的典故。這也就是為什麼說話者對於一個成語的典故完全不了解,卻仍然可以正確地運用與理解這個成語。有些成語的現代語意與典故中的意義正好相反,如果一定要熟悉典故才能運用成語,那麼這一類的成語是不會存在的。

許多一般的詞也不能由字面來推敲出語意,使用者也不知道字面上的語意是怎麼發展到今天這樣,而語音與語意間的關係也是任意的 (arbitrary),但這些都無礙該詞的使用,這與成語是類似的。例如,現代人仍然使用「撥」一詞來稱呼輸入電話號碼或打電話的動作 (例如「請稍後再撥」、「撥號網路」等等),卻很少想到或了解到「撥」的典故:它來自舊時代的轉盤式電話。現代人(尤其是完全沒用過轉盤式電話的卻仍使用這個用法的人)在說「請你撥一通電話」的時候,恐怕早已將「撥」與打電話方面的語意直接連結起來,而沒有經過典故。另外,現代人很少用矛和盾兩種兵器,但「矛盾」一詞仍然被廣為使用,大概也很少人會認為這個詞不能用在現代,這也是因為它的引申義才是重點,背後的典故是另外一回事。

不過這衍生出一個問題:既然典故未知,這些詞與成語的運用是怎麼被正確地學會呢?「語境」是一個原因。說話者學得一個詞或成語不一定是去了解其典故或語意解釋,而是藉著其出現的環境或上下文來學會。

我不太贊成任何成語脫離典故就會沒意義的說法,尤其許多成語早已成為現代口語的一部份,我們很難也沒必要刻意迴避。當然,有些較為冷僻的成語,並沒有完全進入現代語言,使用它們反而無助於溝通,所以,什麼成語值得用、或該用在何時何地,可能才是大家該傷腦筋的。

本文同步刊登於符號工作站

Tuesday, February 6, 2007

談成語(上)

最近教育部的成語典引起了一些話題,因為這個網站把「三隻小豬」等童話故事與電影的名稱也列為成語,而在教育部長「力挺」還親自造句之後,該網站召集人卻說並沒有把這些用語當作成語,並改為連結到附錄網頁。其實我之前在使用這個成語典時,就曾發現「傑克與魔豆」等特別的「成語」,當時除了笑了一下,還「拍照留念」。

對於「成語」,似乎很少人可以提出一個很精確的定義,不過在語言學中有一個類似的概念,叫做「idiom」。在句法學上,「詞」(word) 可以構成詞組 (phrase) 進而形成句子,而每個詞都有其語意或功能。至於 idiom 也和詞類似,可以是句子的元素,也是一個承載語意的單位,它特別之處在於它是由多個詞組成,但是它本身的語意,卻不直接等於組成它的那些詞的語意的組合。例如,「青梅竹馬」並不是指青梅與竹馬兩種物品,而是指從小在一起的同伴。所以,idiom 本身構成一個獨特的單位,而不止是一些相鄰出現的詞,它的語意是約定俗成的直接加在這個單位上。

另外 idiom 本身也可能有自己的詞性,例如「見義勇為」看起來是動詞,但很多人會同意「他這個人很見義勇為」這句話是通的,這裡的「見義勇為」已經不像動詞而比較像形容詞了。另外,許多 idiom 內部的用詞也不能自由替換,即使語意上合乎邏輯也不行,例如「緣木求魚」若說成「緣木求蝦」、「緣木求蛤」都可能難以讓聽者理解。而中文的「成語」大體上是有著這些特性的。

在此我們就試著藉用以上特性,來檢視一下那些童話與電影名稱適不適合稱為成語。以「七年之癢」為例,成語典所列例句如下:

王先生最近都很晚回家,該不會是患了七年之癢吧?

這裡的「七年之癢」當然不是指誰真的在癢,也不一定要剛好結婚七年才能用,它的用法也是固定的,並不是結婚N年就都會講成N年之癢,所以它的確可以是 idiom 或成語,大可列為一般成語而非附錄。照同樣的標準,「國王的新衣」、「麻雀變鳳凰」也的確形成了 idiom。

可是「三隻小豬」呢?讓我們看看成語典的例句:

我們要記取三隻小豬的教訓,今天既然要建橋,就要建最堅固的橋。

在這句話中,三隻小豬可以指涉該童話故事,或指涉故事中那三隻豬,不論是前者或後者,「三隻小豬」這四個字整體來看與個別來看都得到同樣的意義,它並沒有自成一個單位而被賦予另外的意義或用法 ,所以,它只是一般的名詞組 (noun phrase) 罷了。而教育部長的造句「不要像三隻小豬裡面的老大一樣,三隻小豬的故事要想一想啊」,也是一樣的情形,並非成語用法。成語典其他例句中的「灰故娘」、「綠野仙蹤」情況也類似。

這樣看來,成語典裡的那些童話與電影名稱,有一部份是夠格算作成語了,但仍有許多並沒有形成成語這樣的單位,或者說沒有 idiom 的特性,而其中甚至有的條目只有典故卻根本沒被例句引用(如「小木偶奇遇記」),所以我想把這部份列為參考語料、而不跟一般成語混淆的確是比較好的做法。

本文同步刊登於符號工作站

Wednesday, November 22, 2006

Mac OS X 的 VoiceOver Utility

上次我們談到 Mac OS X 的語音技術,而 Mac OS X 10.4 裡所謂的 VoiceOver 功能,其實就是利用 Mac OS X 裡的語音合成功能來輔助有障礙的使用者進行操作,例如它可以朗讀出使用者目前操作的狀態或正在操作的介面名稱,甚至可以把信件或網頁的內容讀出。 Mac OS X 裡有一個稱為 VoiceOver Utility 的小程式(位於「應用程式」>「工具程式」目錄中),可以用來控制 VoiceOver 這個輔助介面。

VoiceOver Utility 可以精細地控制很多 VoiceOver 的設定。就語音合成來說,它可讓使用者選擇每個語音要用在什麼場合,而且它還可以調整語音的速度、音高、以及音量。

不過 VoiceOver Utility 裡有個挺有趣的地方,就是在 Pronunciation (發音)這個標籤底下,如果使用者對一個詞的發音方式不滿意,可以在這裡把那個詞設定成特定的念法,而不要照電腦預設的方式念,例如把「GIF」強制念成「jiff」,而不要念成「G」、「I」、「F」。程式裡已經預先設定好幾個取代方法,除了「GIF」之外,還有的設定是把無線網路標準「802.11b」念成「8 oh 2 eleven b」、以及把表情符號「 :-) 」念成「smiley」。可惜現在 SCSI 傳輸方式已經不流行,不然可能會看到有的設定是用「scuzzy」來念「SCSI」一詞。

在這些預設的設定中,特別引起我注意的是它把「SQL」一詞用「sequel」的念法來取代。SQL 是 Structured Query Language 的縮寫,是一個很受歡迎的資料庫語言。它正式的念法其實應該是 S-Q-L(將字母直接念出),而且有些人認為這才是唯一正確的發音,sequel 的念法是錯誤的。不過從 VoiceOver Utility 裡的這項設定來看,把 SQL 念成 sequel 的做法顯然早已被廣泛採用,也許加入這項設定的人,已經認為 sequel 是更容易使人理解的念法。這或許也意味著,那些認為「S-Q-L」才對的人,其實大可不必去糾正別人「sequel」的念法。

不論 SQL 的念法如何,如果這種自定發音的功能可以加入未來的語音合成,那應該會使語音功能更加實用。例如,我們可以乾脆把「宏碁」設定成一律念成「宏基」,來個將錯就錯。

本文同步刊登於符號工作站


Thursday, October 26, 2006

Unihan Variant Dictionary 支援 Intel Mac

我們去年推出的異體字查詢工具 Unihan Variant Dictionary 現在也有 Universal Binary 版本了。這個可供查詢 Unicode 收錄的異體漢字、並能顯示五種語言字音與英語釋義的小軟體,現在是 1.1.0 版。它除了直接支援 PowerPC 與 Intel 處理器外,還增加了繁體中文介面,因此若是在系統偏好設定中將系統語系設定為繁體中文,開啟 Unihan Variant Dictionary 時它就會變成繁體中文介面。另外資料庫架構也有變動,現在查詢速度應該會快一些。

不過在轉換為 Universal Binary 時,也發現這個過程不如想像中順利, 而軟體的大小也膨脹了一倍,這些大概都是 Mac 轉換到 Intel 平台的代價。 Intel 上的運作情形歡迎大家多多測試,若有問題還請不吝告知。

本文同步刊登於符號工作站