Wednesday, July 4, 2007

猜猜「王力巨集」是誰

最近看到這個一段時間之前的網頁,有一個地方頗讓人覺得納悶,就是裡面有好幾個「王力巨集」這樣的詞。不過想一想就知道這是指「王力宏」,至於怎麼會變成「王力巨集」,恐怕就有點有趣了。

由於對岸都將電腦上的「macro」這個詞翻成「宏」,而在台灣是翻成「巨集」,這個網頁大概進行了某種兩岸用詞的替換,結果就把「宏」這個字換成了「巨集」,這樣一來,這位歌手的名字也就被竄改了。

把「macro」翻成「宏」,就可以衍生出「鍵盤宏」、「鼠標宏」這樣的詞。「Macro = 宏」似乎是對岸常見的直譯法的範例之一(macroscopic = 宏觀的,所以 macro = 宏?),就我的語感來說,實在很難認同,而之所以難認同,我猜大概是以下四個方面的因素:

  1. 「宏」這個字的語意與電腦術語「macro」的原意有一些差距。
  2. 「宏」只有一個音節,與現代漢語常見新詞的雙音節有所不同。
  3. 「宏」與許多古代留下的單音節詞一樣,在現代漢語中已經不可獨立使用,而通常是其他雙音節詞的一部份,例如:「 很宏偉」這三個字沒問題,但「很宏」就不通了。
  4. 「宏」原來的詞性(或說 grammatical category)似乎較少當名詞用。例如「宏偉」、「宏願」的「宏」較像形容詞,而「宏揚」的「宏」應該是修飾動詞,所以比較像個副詞。

看來對岸的翻法,似乎常常不理會包括音節數、詞性、語境(上下文)等因素,這竟然跟機器翻譯頗有相似之處。

至於前面說到的網頁之所以把人名中的「宏」換成「巨集」,大概就是為了處理詞彙差異,而用程式自動替換的結果,不過奇怪的是只有後面的「宏」被取代,不知是怎麼回事。

如果「王力巨集」、「王巨集恩」真的是程式自動取代所造成的,那麼我們只好等待聰明的人類能讓電腦變得夠聰明了。

本文同步刊登於符號工作站

Sunday, June 3, 2007

人名拼音中的鼻音尾

台灣有很多人在講話時沒有完全分清楚注音裡的ㄣ與ㄥ這兩個音,尤其是弄不清ㄧㄣ (in) 跟ㄧㄥ (ing) 的分別。有些人會把ㄧㄣ跟ㄧㄥ一律發成ㄧㄣ,有些人會一律發成ㄧㄥ。有一些中文名字的羅馬拼音會把 n 與 ng 搞錯,不知道是不是這種現象的反映。像王建民在美國大聯盟的官方資料裡,姓名的拼音是 Chien-Ming Wang,但是「民」這個字的拼音顯然是 min 才對。

另外注音中聲母直接加ㄥ或ㄣ的組合也常被混淆,比較常見的應該是都念成聲母+ㄣ,例如很多人會把「成」念成 ㄔㄣˊ (chén)。不過一位人類學界前輩臧振華,他用的姓名拼音是 Tsang Cheng-hwa,這倒是把「振」 的 n 拼成了 ng。

另外有點匪夷所思的是導演李安的名字 Ang Lee,照理說「安」應是 an,拼成 ang 不知只是個不小心的錯誤或是有什麼典故。有些漢語的確會把ㄢ跟ㄤ兩者合併成一類,在台灣有時也會聽說有人不容易發好這類的音、或一時不「輪轉」而把其中一種念成另外一種,不過應該還沒有到普遍地完全不區分ㄢ與ㄤ的地步。

歌手王力宏的名字 Leehom 則是個更特別的例子,如果這名字的確是來自「力宏」兩字的發音的話,那原應以 ng 結尾的「宏」會變成以 m 結尾,實在另人想不透。

當然這些拼音只要是本人固定使用的形式,別人就得照樣引用,畢竟這是他們自己的名字,拼音上的對錯倒成其次,不過其中也許透露出了一些有趣的語言現象。

本文同步刊登於符號工作站

Tuesday, May 8, 2007

談成語(下)

前面我們以語言學上 idiom 概念來檢驗中文的成語,不過事實上語言學的 idiom 與中文裡所說的成語恐怕還是有些差異,畢竟一個是學術名詞,一個則是約定俗成的名詞。中文的「成語」有一個特別的地方是,它們幾乎都是由四個字組成的,成語典收錄的童話故事和電影名稱有一些卻不是四個字,那麼非四字的組合可以算成語嗎?

就語言學的角度來看,不同音節數(在中文即為字數)的 idiom 並沒有各自在語言法則上有不同的表現,也就是三個字、四個字、或五個字的分別並未形成不同的有意義的類別,所以音節數自然不會成為判斷 idiom 成立與否的準備了。如果用這個角度來看,許多非四字的用語是可以被納入成語之中的。

可是如前所述,中文裡所說的成語並不是一個具有精確學術定義的概念,所以情況也可能不太一樣。我們可以看看教育部的成語典如何處理這個問題。只要在成語典裡搜尋一下,就可以在搜尋結果中發現許多超過四個字的「成語」,例如「山不轉路轉」、「畫虎不成反類犬」等等,甚至也有三字的成語,例如「東道主」。只是一方面這些非四字的成語還是少數,另一方面,這些非四字成語似乎大多被放在附錄而非一般成語,所以四字成語的傾向應該還是存在於成語典的。

雖然如前所述,成語的字數在語言學上沒有意義,但是「成語就該是四個字」的想法也不一定就不值一探。漢語既然有豐富的單音節語位,也就有條件把成語組成四個字的單位,在四字成語佔大多數的情況下,就形成了一種不可忽略的模式。而且超過四個字的用語有可能因為表達比較豐富或較為白話,而讓人更注意到其字面本身的意義,其用法也就不是那麼「成語」了。

另外,想在這裡提一下的是成語典的另一個問題:整個系統的設計。成語典主編者說他們並未將那些有爭議的部份當成成語,而且也很快地把它們移到了「參考語料」之中。如果我們相信主編者的說法,也就是相信他們原本就認定「三隻小豬」是附錄性質而非真正的成語的話,那麼成語典所出的問題顯然就是在前端的設計上。在建構資料庫與網頁介面時,操刀的人可能便宜行事,使得成語與參考語料的呈現方式沒有分別,等到鬧出事情後主事者才想者亡羊補牢,卻已經不可收拾了。看看成語典混亂而不易使用的介面,就不難想像它設計上的問題會如何減損它內容的價值。

我想「三隻小豬」的收錄除了爭議那一面之外,應該還是有其正面意義的,它代表成語典忠實地反映與記錄了這個時代的語言,只是提供的方式應該是要再精緻一些了。

寫在最後:成語典把「楚門的世界」原名寫成 The Trueman Show,第二個詞對照該電影的官方原文 Truman 多了一個 e,恐怕還是完全按照原文來寫會比較好。

本文同步刊登於符號工作站

Saturday, April 7, 2007

Unihan Variant Dictionary 1.2.0

異體字查詢軟體 Unihan Variant Dictionary 在上次改版為 Universal Binary 版本後,在 Intel Mac 上出現了一些問題,現在我們已經把它改正,遇到問題的朋友可以下載新的 1.2.0 版

之前的 Universal 版本之所以在 Intel 機器上會出問題,是 PowerPC 與 Intel 處理器的位元排列順序不同所致。過去的 Mac OS X 在 PowerPC 上運作,採用的是 big-endian,但到了 Intel 處理器上,就變成 little-endian, 例如,一個號碼 0A0B 的字元,若是由 0A 與 0B 兩個位元組成,big-endian 的排列是 0A0B,little-endian 的排列卻是 0B0A。我們在 Unihan Variant Dictionary 1.2.0 中特別處理了這個問題,所以現在不論用哪個平台都可以查詢到正確的結果。

另外,對於 Unicode 碼五位數以上的字元,現在也做了比較好的處理。例如圖中的兩個「形」字 ,上面那個 Unicode 碼是 2F899 ,下面的是一般常見的 5F62 ,你看出不同在哪裡了嗎?

本文同步刊登於符號工作站

Saturday, March 31, 2007

談成語(中)

教育部長說,成語會使人「思想懶惰」、「一知半解」,「成語一旦脫離情境,就會沒有意義」,「如果成語故事大家不熟悉,寫出來的成語、用出來的典故,就和生活以及要表達的感情無關或很淡泊」。我們在此也針對相關的問題來討論討論。

關於「思想懶惰」這件事,有的慣用語似乎是有可能將事情過度簡化。例如有些人聽到小道消息,大部份情況下會選擇相信,而理由呢?常常就是五個字:「無風不起浪」。其實傳言只要未經證實,當然都有某種機率是假的,但一句「無風不起浪」似乎就讓真偽之辨的討論空間變得很小了。

可是如果說成語的典故對現代人都沒意義、運用成語就得了解典故,所以使用成語是不好的,就有些不太對勁的地方了。其實,一般人能使用或理解成語,並不以了解典故為必要條件。如上篇文章所說,成語是以兩個以上詞為一個單位而被直接賦予意義,所以就像許多的詞一樣,它作為一個語意承載單位,有一個約定俗成的意義,說話者可以直接將成語與其語意連結起來,不一定要經過背後的典故。這也就是為什麼說話者對於一個成語的典故完全不了解,卻仍然可以正確地運用與理解這個成語。有些成語的現代語意與典故中的意義正好相反,如果一定要熟悉典故才能運用成語,那麼這一類的成語是不會存在的。

許多一般的詞也不能由字面來推敲出語意,使用者也不知道字面上的語意是怎麼發展到今天這樣,而語音與語意間的關係也是任意的 (arbitrary),但這些都無礙該詞的使用,這與成語是類似的。例如,現代人仍然使用「撥」一詞來稱呼輸入電話號碼或打電話的動作 (例如「請稍後再撥」、「撥號網路」等等),卻很少想到或了解到「撥」的典故:它來自舊時代的轉盤式電話。現代人(尤其是完全沒用過轉盤式電話的卻仍使用這個用法的人)在說「請你撥一通電話」的時候,恐怕早已將「撥」與打電話方面的語意直接連結起來,而沒有經過典故。另外,現代人很少用矛和盾兩種兵器,但「矛盾」一詞仍然被廣為使用,大概也很少人會認為這個詞不能用在現代,這也是因為它的引申義才是重點,背後的典故是另外一回事。

不過這衍生出一個問題:既然典故未知,這些詞與成語的運用是怎麼被正確地學會呢?「語境」是一個原因。說話者學得一個詞或成語不一定是去了解其典故或語意解釋,而是藉著其出現的環境或上下文來學會。

我不太贊成任何成語脫離典故就會沒意義的說法,尤其許多成語早已成為現代口語的一部份,我們很難也沒必要刻意迴避。當然,有些較為冷僻的成語,並沒有完全進入現代語言,使用它們反而無助於溝通,所以,什麼成語值得用、或該用在何時何地,可能才是大家該傷腦筋的。

本文同步刊登於符號工作站

Tuesday, February 6, 2007

談成語(上)

最近教育部的成語典引起了一些話題,因為這個網站把「三隻小豬」等童話故事與電影的名稱也列為成語,而在教育部長「力挺」還親自造句之後,該網站召集人卻說並沒有把這些用語當作成語,並改為連結到附錄網頁。其實我之前在使用這個成語典時,就曾發現「傑克與魔豆」等特別的「成語」,當時除了笑了一下,還「拍照留念」。

對於「成語」,似乎很少人可以提出一個很精確的定義,不過在語言學中有一個類似的概念,叫做「idiom」。在句法學上,「詞」(word) 可以構成詞組 (phrase) 進而形成句子,而每個詞都有其語意或功能。至於 idiom 也和詞類似,可以是句子的元素,也是一個承載語意的單位,它特別之處在於它是由多個詞組成,但是它本身的語意,卻不直接等於組成它的那些詞的語意的組合。例如,「青梅竹馬」並不是指青梅與竹馬兩種物品,而是指從小在一起的同伴。所以,idiom 本身構成一個獨特的單位,而不止是一些相鄰出現的詞,它的語意是約定俗成的直接加在這個單位上。

另外 idiom 本身也可能有自己的詞性,例如「見義勇為」看起來是動詞,但很多人會同意「他這個人很見義勇為」這句話是通的,這裡的「見義勇為」已經不像動詞而比較像形容詞了。另外,許多 idiom 內部的用詞也不能自由替換,即使語意上合乎邏輯也不行,例如「緣木求魚」若說成「緣木求蝦」、「緣木求蛤」都可能難以讓聽者理解。而中文的「成語」大體上是有著這些特性的。

在此我們就試著藉用以上特性,來檢視一下那些童話與電影名稱適不適合稱為成語。以「七年之癢」為例,成語典所列例句如下:

王先生最近都很晚回家,該不會是患了七年之癢吧?

這裡的「七年之癢」當然不是指誰真的在癢,也不一定要剛好結婚七年才能用,它的用法也是固定的,並不是結婚N年就都會講成N年之癢,所以它的確可以是 idiom 或成語,大可列為一般成語而非附錄。照同樣的標準,「國王的新衣」、「麻雀變鳳凰」也的確形成了 idiom。

可是「三隻小豬」呢?讓我們看看成語典的例句:

我們要記取三隻小豬的教訓,今天既然要建橋,就要建最堅固的橋。

在這句話中,三隻小豬可以指涉該童話故事,或指涉故事中那三隻豬,不論是前者或後者,「三隻小豬」這四個字整體來看與個別來看都得到同樣的意義,它並沒有自成一個單位而被賦予另外的意義或用法 ,所以,它只是一般的名詞組 (noun phrase) 罷了。而教育部長的造句「不要像三隻小豬裡面的老大一樣,三隻小豬的故事要想一想啊」,也是一樣的情形,並非成語用法。成語典其他例句中的「灰故娘」、「綠野仙蹤」情況也類似。

這樣看來,成語典裡的那些童話與電影名稱,有一部份是夠格算作成語了,但仍有許多並沒有形成成語這樣的單位,或者說沒有 idiom 的特性,而其中甚至有的條目只有典故卻根本沒被例句引用(如「小木偶奇遇記」),所以我想把這部份列為參考語料、而不跟一般成語混淆的確是比較好的做法。

本文同步刊登於符號工作站

Wednesday, November 22, 2006

Mac OS X 的 VoiceOver Utility

上次我們談到 Mac OS X 的語音技術,而 Mac OS X 10.4 裡所謂的 VoiceOver 功能,其實就是利用 Mac OS X 裡的語音合成功能來輔助有障礙的使用者進行操作,例如它可以朗讀出使用者目前操作的狀態或正在操作的介面名稱,甚至可以把信件或網頁的內容讀出。 Mac OS X 裡有一個稱為 VoiceOver Utility 的小程式(位於「應用程式」>「工具程式」目錄中),可以用來控制 VoiceOver 這個輔助介面。

VoiceOver Utility 可以精細地控制很多 VoiceOver 的設定。就語音合成來說,它可讓使用者選擇每個語音要用在什麼場合,而且它還可以調整語音的速度、音高、以及音量。

不過 VoiceOver Utility 裡有個挺有趣的地方,就是在 Pronunciation (發音)這個標籤底下,如果使用者對一個詞的發音方式不滿意,可以在這裡把那個詞設定成特定的念法,而不要照電腦預設的方式念,例如把「GIF」強制念成「jiff」,而不要念成「G」、「I」、「F」。程式裡已經預先設定好幾個取代方法,除了「GIF」之外,還有的設定是把無線網路標準「802.11b」念成「8 oh 2 eleven b」、以及把表情符號「 :-) 」念成「smiley」。可惜現在 SCSI 傳輸方式已經不流行,不然可能會看到有的設定是用「scuzzy」來念「SCSI」一詞。

在這些預設的設定中,特別引起我注意的是它把「SQL」一詞用「sequel」的念法來取代。SQL 是 Structured Query Language 的縮寫,是一個很受歡迎的資料庫語言。它正式的念法其實應該是 S-Q-L(將字母直接念出),而且有些人認為這才是唯一正確的發音,sequel 的念法是錯誤的。不過從 VoiceOver Utility 裡的這項設定來看,把 SQL 念成 sequel 的做法顯然早已被廣泛採用,也許加入這項設定的人,已經認為 sequel 是更容易使人理解的念法。這或許也意味著,那些認為「S-Q-L」才對的人,其實大可不必去糾正別人「sequel」的念法。

不論 SQL 的念法如何,如果這種自定發音的功能可以加入未來的語音合成,那應該會使語音功能更加實用。例如,我們可以乾脆把「宏碁」設定成一律念成「宏基」,來個將錯就錯。

本文同步刊登於符號工作站