Saturday, March 31, 2007

談成語(中)

教育部長說,成語會使人「思想懶惰」、「一知半解」,「成語一旦脫離情境,就會沒有意義」,「如果成語故事大家不熟悉,寫出來的成語、用出來的典故,就和生活以及要表達的感情無關或很淡泊」。我們在此也針對相關的問題來討論討論。

關於「思想懶惰」這件事,有的慣用語似乎是有可能將事情過度簡化。例如有些人聽到小道消息,大部份情況下會選擇相信,而理由呢?常常就是五個字:「無風不起浪」。其實傳言只要未經證實,當然都有某種機率是假的,但一句「無風不起浪」似乎就讓真偽之辨的討論空間變得很小了。

可是如果說成語的典故對現代人都沒意義、運用成語就得了解典故,所以使用成語是不好的,就有些不太對勁的地方了。其實,一般人能使用或理解成語,並不以了解典故為必要條件。如上篇文章所說,成語是以兩個以上詞為一個單位而被直接賦予意義,所以就像許多的詞一樣,它作為一個語意承載單位,有一個約定俗成的意義,說話者可以直接將成語與其語意連結起來,不一定要經過背後的典故。這也就是為什麼說話者對於一個成語的典故完全不了解,卻仍然可以正確地運用與理解這個成語。有些成語的現代語意與典故中的意義正好相反,如果一定要熟悉典故才能運用成語,那麼這一類的成語是不會存在的。

許多一般的詞也不能由字面來推敲出語意,使用者也不知道字面上的語意是怎麼發展到今天這樣,而語音與語意間的關係也是任意的 (arbitrary),但這些都無礙該詞的使用,這與成語是類似的。例如,現代人仍然使用「撥」一詞來稱呼輸入電話號碼或打電話的動作 (例如「請稍後再撥」、「撥號網路」等等),卻很少想到或了解到「撥」的典故:它來自舊時代的轉盤式電話。現代人(尤其是完全沒用過轉盤式電話的卻仍使用這個用法的人)在說「請你撥一通電話」的時候,恐怕早已將「撥」與打電話方面的語意直接連結起來,而沒有經過典故。另外,現代人很少用矛和盾兩種兵器,但「矛盾」一詞仍然被廣為使用,大概也很少人會認為這個詞不能用在現代,這也是因為它的引申義才是重點,背後的典故是另外一回事。

不過這衍生出一個問題:既然典故未知,這些詞與成語的運用是怎麼被正確地學會呢?「語境」是一個原因。說話者學得一個詞或成語不一定是去了解其典故或語意解釋,而是藉著其出現的環境或上下文來學會。

我不太贊成任何成語脫離典故就會沒意義的說法,尤其許多成語早已成為現代口語的一部份,我們很難也沒必要刻意迴避。當然,有些較為冷僻的成語,並沒有完全進入現代語言,使用它們反而無助於溝通,所以,什麼成語值得用、或該用在何時何地,可能才是大家該傷腦筋的。

本文同步刊登於符號工作站

Tuesday, February 6, 2007

談成語(上)

最近教育部的成語典引起了一些話題,因為這個網站把「三隻小豬」等童話故事與電影的名稱也列為成語,而在教育部長「力挺」還親自造句之後,該網站召集人卻說並沒有把這些用語當作成語,並改為連結到附錄網頁。其實我之前在使用這個成語典時,就曾發現「傑克與魔豆」等特別的「成語」,當時除了笑了一下,還「拍照留念」。

對於「成語」,似乎很少人可以提出一個很精確的定義,不過在語言學中有一個類似的概念,叫做「idiom」。在句法學上,「詞」(word) 可以構成詞組 (phrase) 進而形成句子,而每個詞都有其語意或功能。至於 idiom 也和詞類似,可以是句子的元素,也是一個承載語意的單位,它特別之處在於它是由多個詞組成,但是它本身的語意,卻不直接等於組成它的那些詞的語意的組合。例如,「青梅竹馬」並不是指青梅與竹馬兩種物品,而是指從小在一起的同伴。所以,idiom 本身構成一個獨特的單位,而不止是一些相鄰出現的詞,它的語意是約定俗成的直接加在這個單位上。

另外 idiom 本身也可能有自己的詞性,例如「見義勇為」看起來是動詞,但很多人會同意「他這個人很見義勇為」這句話是通的,這裡的「見義勇為」已經不像動詞而比較像形容詞了。另外,許多 idiom 內部的用詞也不能自由替換,即使語意上合乎邏輯也不行,例如「緣木求魚」若說成「緣木求蝦」、「緣木求蛤」都可能難以讓聽者理解。而中文的「成語」大體上是有著這些特性的。

在此我們就試著藉用以上特性,來檢視一下那些童話與電影名稱適不適合稱為成語。以「七年之癢」為例,成語典所列例句如下:

王先生最近都很晚回家,該不會是患了七年之癢吧?

這裡的「七年之癢」當然不是指誰真的在癢,也不一定要剛好結婚七年才能用,它的用法也是固定的,並不是結婚N年就都會講成N年之癢,所以它的確可以是 idiom 或成語,大可列為一般成語而非附錄。照同樣的標準,「國王的新衣」、「麻雀變鳳凰」也的確形成了 idiom。

可是「三隻小豬」呢?讓我們看看成語典的例句:

我們要記取三隻小豬的教訓,今天既然要建橋,就要建最堅固的橋。

在這句話中,三隻小豬可以指涉該童話故事,或指涉故事中那三隻豬,不論是前者或後者,「三隻小豬」這四個字整體來看與個別來看都得到同樣的意義,它並沒有自成一個單位而被賦予另外的意義或用法 ,所以,它只是一般的名詞組 (noun phrase) 罷了。而教育部長的造句「不要像三隻小豬裡面的老大一樣,三隻小豬的故事要想一想啊」,也是一樣的情形,並非成語用法。成語典其他例句中的「灰故娘」、「綠野仙蹤」情況也類似。

這樣看來,成語典裡的那些童話與電影名稱,有一部份是夠格算作成語了,但仍有許多並沒有形成成語這樣的單位,或者說沒有 idiom 的特性,而其中甚至有的條目只有典故卻根本沒被例句引用(如「小木偶奇遇記」),所以我想把這部份列為參考語料、而不跟一般成語混淆的確是比較好的做法。

本文同步刊登於符號工作站

Wednesday, November 22, 2006

Mac OS X 的 VoiceOver Utility

上次我們談到 Mac OS X 的語音技術,而 Mac OS X 10.4 裡所謂的 VoiceOver 功能,其實就是利用 Mac OS X 裡的語音合成功能來輔助有障礙的使用者進行操作,例如它可以朗讀出使用者目前操作的狀態或正在操作的介面名稱,甚至可以把信件或網頁的內容讀出。 Mac OS X 裡有一個稱為 VoiceOver Utility 的小程式(位於「應用程式」>「工具程式」目錄中),可以用來控制 VoiceOver 這個輔助介面。

VoiceOver Utility 可以精細地控制很多 VoiceOver 的設定。就語音合成來說,它可讓使用者選擇每個語音要用在什麼場合,而且它還可以調整語音的速度、音高、以及音量。

不過 VoiceOver Utility 裡有個挺有趣的地方,就是在 Pronunciation (發音)這個標籤底下,如果使用者對一個詞的發音方式不滿意,可以在這裡把那個詞設定成特定的念法,而不要照電腦預設的方式念,例如把「GIF」強制念成「jiff」,而不要念成「G」、「I」、「F」。程式裡已經預先設定好幾個取代方法,除了「GIF」之外,還有的設定是把無線網路標準「802.11b」念成「8 oh 2 eleven b」、以及把表情符號「 :-) 」念成「smiley」。可惜現在 SCSI 傳輸方式已經不流行,不然可能會看到有的設定是用「scuzzy」來念「SCSI」一詞。

在這些預設的設定中,特別引起我注意的是它把「SQL」一詞用「sequel」的念法來取代。SQL 是 Structured Query Language 的縮寫,是一個很受歡迎的資料庫語言。它正式的念法其實應該是 S-Q-L(將字母直接念出),而且有些人認為這才是唯一正確的發音,sequel 的念法是錯誤的。不過從 VoiceOver Utility 裡的這項設定來看,把 SQL 念成 sequel 的做法顯然早已被廣泛採用,也許加入這項設定的人,已經認為 sequel 是更容易使人理解的念法。這或許也意味著,那些認為「S-Q-L」才對的人,其實大可不必去糾正別人「sequel」的念法。

不論 SQL 的念法如何,如果這種自定發音的功能可以加入未來的語音合成,那應該會使語音功能更加實用。例如,我們可以乾脆把「宏碁」設定成一律念成「宏基」,來個將錯就錯。

本文同步刊登於符號工作站


Thursday, October 26, 2006

Unihan Variant Dictionary 支援 Intel Mac

我們去年推出的異體字查詢工具 Unihan Variant Dictionary 現在也有 Universal Binary 版本了。這個可供查詢 Unicode 收錄的異體漢字、並能顯示五種語言字音與英語釋義的小軟體,現在是 1.1.0 版。它除了直接支援 PowerPC 與 Intel 處理器外,還增加了繁體中文介面,因此若是在系統偏好設定中將系統語系設定為繁體中文,開啟 Unihan Variant Dictionary 時它就會變成繁體中文介面。另外資料庫架構也有變動,現在查詢速度應該會快一些。

不過在轉換為 Universal Binary 時,也發現這個過程不如想像中順利, 而軟體的大小也膨脹了一倍,這些大概都是 Mac 轉換到 Intel 平台的代價。 Intel 上的運作情形歡迎大家多多測試,若有問題還請不吝告知。

本文同步刊登於符號工作站


Sunday, September 24, 2006

Leopard 的語音合成

2001 年的蘋果 Speech 網頁。

其實我已經嫌 Mac OS X 的語音合成功能很久了。大家若是看過蘋果創辦人之一 Steve Jobs 在 1984 年發表第一部 Macintosh 的影片,就知道那時的 Mac 已經有語音合成的功能了,而且 Jobs 似乎還為了那部小 Mac 一段感人肺腑的話而熱淚盈眶,就像第一次聽到兒子叫爸爸一樣。不過隨著時代的演進,Mac 的語音合成似乎沒多大進步,雖然後來是多了幾個較高品質的語音可選擇,但改進仍很有限。甚至自從進入 Mac OS X 時代後,原來的中文與西班牙文發音功能也無疾而終,我們也只能對「小趙」寄予無限的懷念。

我曾經介紹過一個在網上提供互動式動畫和語音的服務 SitePal,那時覺得這樣的服務都能有相當自然的發音,顯然 Mac OS X 也該加把勁了。終於在今年的全球開發者會議 (WWDC) 上, 蘋果展示了新的語音合成技術,它使用的「Alex」語音可以發出相當接近人聲的英語發音。雖然現在我們仍無法有實際操作的機會,但從現場的展示以及官方網站的範例來看,它的表現的確有很大的進步。在展示時 Steve Jobs 還秀了一段超快速的朗讀,效果也相當不錯。而且根據網頁上所述,蘋果的語音合成支援雙位元的語文,所以有中文與日文發音的能力。目前看不出 Mac OS X 本身是否會直接內建中文語音、還是只是留下空間給外界開發,不過這樣的發展還是給我們很大的期待。

我自己在使用即時通訊軟體 Proteus 時,有時會設定成讓它在有人上線時自動用語音報上名來,這樣就算沒有看到電腦螢幕,也知道是什麼人上線。只是由於現在系統的語音只支援英文,所以遇到以中文為使用者名稱的人就無用武之地了。從蘋果公布的內容看來,未來 iChat 可以自動朗讀對方送來訊息,若是也有上線類似 Proteus 的上線通知,再加上中文支援,那就相當實用了(至少對某些人來說)。

更好的 text-to-speech 結合到 Mac OS X 這個豐富的作業系統後,相信有很多有趣的應用方式,也能減少很多人的障礙,未來的發展如何,就讓我們拭目以待吧。

本文同步刊登於符號工作站


Wednesday, August 16, 2006

可以 Google 一下嗎?

上個月韋氏字典才把 Google 一詞當成動詞收錄進去,但據說最近 Google 發函媒體,要求不得將 Google 當成動詞使用,以保護 Google 的商標。Google 還列出例句,來說明 Google 一詞正確的用法:

正確:I ran a Google search to check out that guy from the party.
錯誤:I googled that hottie.

第一句的 Google 還保留大寫,還是個專有名詞,指的也是 Google 本身,第二句則不再大寫,不再是專有名詞,還轉成動詞使用,結果被 Google 當成不當用法。顯然 Google 並沒有對於 Google 一詞普及化感到太高興,反而有些隱憂。從相關報導看起來,他們擔心的應該就是 Google 這個專有名詞和商標被一般人當成普通名詞來使用,甚至廣泛地指涉到同類型的事物上,進而造成 Google 失去此商標的相關權利。

對於 Google 的舉動,網上已有人提出不以為然的看法,還故意使用了 jacuzzi、hoover、xerox 等詞,來指出專有名詞變成普通名詞的現象。另一個很有名的的例子是「Walkman」,在一般人的用法中,這個 Sony 公司的商標早已成了普通名詞,現在不論是哪家廠商出的類似裝置,都會被一般人稱做「Walkman」(中文則稱為「隨身聽」)。而台灣人所說的「立可白」,原來也只是某一特定商品的名稱,後來也用作普通名詞,泛指所有的同類型產品。另一個年代久遠的例子是「非肥皂」,它原本是某家公司的商品名稱,在「洗衣粉」一詞興起前,據說它曾被普遍地用來指稱所有粉狀洗衣劑。(我沒經歷那個年代,若有錯誤敬請指正。)只是從大部份例子來看,廠商再怎麼採取行動捍衛商標,通常還是不敵「廣大群眾」的力量,不管在法律上能否保住商標,都無法阻止一般人繼續在口語中使用。

由這些例子看起來,一個商品名稱或商標如果經歷了專有名詞普通化的過程,通常代表該項商品在業界有開創性,因而被大眾當成同類商品的代名詞。如此看來,Google 應該是要驕傲的。可是如果他們想要搞些動作來擋住這個過程,不但在成效上要打一個大問號,而且對自己的企業形象也可能不太正面。雖然 Google 的影響力無遠弗屆,但我相信語言演變的力量仍是 Google 無法駕馭的。

本文同步刊登於符號工作站


Wednesday, July 26, 2006

南島語族是哪一族?

最近被問到跟南島文化節與南島語系有關的問題時,我發現有許多人在使用「南島語族」一詞時,的確是會有些誤解的,他們會把「南島語族」當成「使用南島語系的族群」來使用。但是「語族」一詞究竟是什麼意義呢?這種用法是否適當呢?我想可以在此做個澄清。

其實,在語言學上,「語族」指的並不是一群人,而是一個語言系屬的單位,目前學界常見的做法,是把「語族」用於「語系」的下一層。能找到同源關係的各語言,可全部歸類為同一「語系」,而語系之下再依親疏遠近分類,又有許多「語族」,「語族」之下則有「語支」。例如根據某些理論,漢藏語系之下有藏緬語族,被歸類為藏緬語族的語言包括藏語、彝語、緬語、羌語等,而這些語言還各可以屬於幾個不同的語支。所以,語族指的是一個語言的家族,而不是人的「民族」、「種族」、或「族群」。

「南島語系」原是歷史語言學上的概念,在廣為人知後,常被引用到許多地方,又有人會以此語系的概念,再衍生出「南島民族」、「南島語族」等稱呼。「南島語族」一詞如前所述有誤用的問題,而「南島民族」一詞其實也不無問題。

語言學家是根據同源詞以及語音對應等等線索,認定某些語言源自同一祖語,並將這些語言歸為同一語系。「南島語系」的建立,是完全靠著語言上的證據,和人無關。「南島語系」的成立,並不隱含著「講這一系語言的人是同一民族」、或「這些人在文化或體質等方面有共通性」的意味。而人的血緣、文化與語言之間對應關係經常是極其複雜的,人類學對於人的區分也有自有標準,若只是因為某些人講的語言被歸為同一語系,就將這些人直接放在一起,稱為某一民族,還以純語言學的語系名稱作為名字,其實是較輕率的做法。實際上,所謂的「南島民族」其實包含眾多各異的族群、文化,這樣多元且歧異的內容如何能在缺乏充分人類學理論的支持下,就合成一個單位呢?

所以我建議,在使用這些名詞時,不妨更謹慎一些。

本文同步刊登於符號工作站