Wednesday, November 22, 2006

Mac OS X 的 VoiceOver Utility

上次我們談到 Mac OS X 的語音技術,而 Mac OS X 10.4 裡所謂的 VoiceOver 功能,其實就是利用 Mac OS X 裡的語音合成功能來輔助有障礙的使用者進行操作,例如它可以朗讀出使用者目前操作的狀態或正在操作的介面名稱,甚至可以把信件或網頁的內容讀出。 Mac OS X 裡有一個稱為 VoiceOver Utility 的小程式(位於「應用程式」>「工具程式」目錄中),可以用來控制 VoiceOver 這個輔助介面。

VoiceOver Utility 可以精細地控制很多 VoiceOver 的設定。就語音合成來說,它可讓使用者選擇每個語音要用在什麼場合,而且它還可以調整語音的速度、音高、以及音量。

不過 VoiceOver Utility 裡有個挺有趣的地方,就是在 Pronunciation (發音)這個標籤底下,如果使用者對一個詞的發音方式不滿意,可以在這裡把那個詞設定成特定的念法,而不要照電腦預設的方式念,例如把「GIF」強制念成「jiff」,而不要念成「G」、「I」、「F」。程式裡已經預先設定好幾個取代方法,除了「GIF」之外,還有的設定是把無線網路標準「802.11b」念成「8 oh 2 eleven b」、以及把表情符號「 :-) 」念成「smiley」。可惜現在 SCSI 傳輸方式已經不流行,不然可能會看到有的設定是用「scuzzy」來念「SCSI」一詞。

在這些預設的設定中,特別引起我注意的是它把「SQL」一詞用「sequel」的念法來取代。SQL 是 Structured Query Language 的縮寫,是一個很受歡迎的資料庫語言。它正式的念法其實應該是 S-Q-L(將字母直接念出),而且有些人認為這才是唯一正確的發音,sequel 的念法是錯誤的。不過從 VoiceOver Utility 裡的這項設定來看,把 SQL 念成 sequel 的做法顯然早已被廣泛採用,也許加入這項設定的人,已經認為 sequel 是更容易使人理解的念法。這或許也意味著,那些認為「S-Q-L」才對的人,其實大可不必去糾正別人「sequel」的念法。

不論 SQL 的念法如何,如果這種自定發音的功能可以加入未來的語音合成,那應該會使語音功能更加實用。例如,我們可以乾脆把「宏碁」設定成一律念成「宏基」,來個將錯就錯。

本文同步刊登於符號工作站


Thursday, October 26, 2006

Unihan Variant Dictionary 支援 Intel Mac

我們去年推出的異體字查詢工具 Unihan Variant Dictionary 現在也有 Universal Binary 版本了。這個可供查詢 Unicode 收錄的異體漢字、並能顯示五種語言字音與英語釋義的小軟體,現在是 1.1.0 版。它除了直接支援 PowerPC 與 Intel 處理器外,還增加了繁體中文介面,因此若是在系統偏好設定中將系統語系設定為繁體中文,開啟 Unihan Variant Dictionary 時它就會變成繁體中文介面。另外資料庫架構也有變動,現在查詢速度應該會快一些。

不過在轉換為 Universal Binary 時,也發現這個過程不如想像中順利, 而軟體的大小也膨脹了一倍,這些大概都是 Mac 轉換到 Intel 平台的代價。 Intel 上的運作情形歡迎大家多多測試,若有問題還請不吝告知。

本文同步刊登於符號工作站


Sunday, September 24, 2006

Leopard 的語音合成

2001 年的蘋果 Speech 網頁。

其實我已經嫌 Mac OS X 的語音合成功能很久了。大家若是看過蘋果創辦人之一 Steve Jobs 在 1984 年發表第一部 Macintosh 的影片,就知道那時的 Mac 已經有語音合成的功能了,而且 Jobs 似乎還為了那部小 Mac 一段感人肺腑的話而熱淚盈眶,就像第一次聽到兒子叫爸爸一樣。不過隨著時代的演進,Mac 的語音合成似乎沒多大進步,雖然後來是多了幾個較高品質的語音可選擇,但改進仍很有限。甚至自從進入 Mac OS X 時代後,原來的中文與西班牙文發音功能也無疾而終,我們也只能對「小趙」寄予無限的懷念。

我曾經介紹過一個在網上提供互動式動畫和語音的服務 SitePal,那時覺得這樣的服務都能有相當自然的發音,顯然 Mac OS X 也該加把勁了。終於在今年的全球開發者會議 (WWDC) 上, 蘋果展示了新的語音合成技術,它使用的「Alex」語音可以發出相當接近人聲的英語發音。雖然現在我們仍無法有實際操作的機會,但從現場的展示以及官方網站的範例來看,它的表現的確有很大的進步。在展示時 Steve Jobs 還秀了一段超快速的朗讀,效果也相當不錯。而且根據網頁上所述,蘋果的語音合成支援雙位元的語文,所以有中文與日文發音的能力。目前看不出 Mac OS X 本身是否會直接內建中文語音、還是只是留下空間給外界開發,不過這樣的發展還是給我們很大的期待。

我自己在使用即時通訊軟體 Proteus 時,有時會設定成讓它在有人上線時自動用語音報上名來,這樣就算沒有看到電腦螢幕,也知道是什麼人上線。只是由於現在系統的語音只支援英文,所以遇到以中文為使用者名稱的人就無用武之地了。從蘋果公布的內容看來,未來 iChat 可以自動朗讀對方送來訊息,若是也有上線類似 Proteus 的上線通知,再加上中文支援,那就相當實用了(至少對某些人來說)。

更好的 text-to-speech 結合到 Mac OS X 這個豐富的作業系統後,相信有很多有趣的應用方式,也能減少很多人的障礙,未來的發展如何,就讓我們拭目以待吧。

本文同步刊登於符號工作站


Wednesday, August 16, 2006

可以 Google 一下嗎?

上個月韋氏字典才把 Google 一詞當成動詞收錄進去,但據說最近 Google 發函媒體,要求不得將 Google 當成動詞使用,以保護 Google 的商標。Google 還列出例句,來說明 Google 一詞正確的用法:

正確:I ran a Google search to check out that guy from the party.
錯誤:I googled that hottie.

第一句的 Google 還保留大寫,還是個專有名詞,指的也是 Google 本身,第二句則不再大寫,不再是專有名詞,還轉成動詞使用,結果被 Google 當成不當用法。顯然 Google 並沒有對於 Google 一詞普及化感到太高興,反而有些隱憂。從相關報導看起來,他們擔心的應該就是 Google 這個專有名詞和商標被一般人當成普通名詞來使用,甚至廣泛地指涉到同類型的事物上,進而造成 Google 失去此商標的相關權利。

對於 Google 的舉動,網上已有人提出不以為然的看法,還故意使用了 jacuzzi、hoover、xerox 等詞,來指出專有名詞變成普通名詞的現象。另一個很有名的的例子是「Walkman」,在一般人的用法中,這個 Sony 公司的商標早已成了普通名詞,現在不論是哪家廠商出的類似裝置,都會被一般人稱做「Walkman」(中文則稱為「隨身聽」)。而台灣人所說的「立可白」,原來也只是某一特定商品的名稱,後來也用作普通名詞,泛指所有的同類型產品。另一個年代久遠的例子是「非肥皂」,它原本是某家公司的商品名稱,在「洗衣粉」一詞興起前,據說它曾被普遍地用來指稱所有粉狀洗衣劑。(我沒經歷那個年代,若有錯誤敬請指正。)只是從大部份例子來看,廠商再怎麼採取行動捍衛商標,通常還是不敵「廣大群眾」的力量,不管在法律上能否保住商標,都無法阻止一般人繼續在口語中使用。

由這些例子看起來,一個商品名稱或商標如果經歷了專有名詞普通化的過程,通常代表該項商品在業界有開創性,因而被大眾當成同類商品的代名詞。如此看來,Google 應該是要驕傲的。可是如果他們想要搞些動作來擋住這個過程,不但在成效上要打一個大問號,而且對自己的企業形象也可能不太正面。雖然 Google 的影響力無遠弗屆,但我相信語言演變的力量仍是 Google 無法駕馭的。

本文同步刊登於符號工作站


Wednesday, July 26, 2006

南島語族是哪一族?

最近被問到跟南島文化節與南島語系有關的問題時,我發現有許多人在使用「南島語族」一詞時,的確是會有些誤解的,他們會把「南島語族」當成「使用南島語系的族群」來使用。但是「語族」一詞究竟是什麼意義呢?這種用法是否適當呢?我想可以在此做個澄清。

其實,在語言學上,「語族」指的並不是一群人,而是一個語言系屬的單位,目前學界常見的做法,是把「語族」用於「語系」的下一層。能找到同源關係的各語言,可全部歸類為同一「語系」,而語系之下再依親疏遠近分類,又有許多「語族」,「語族」之下則有「語支」。例如根據某些理論,漢藏語系之下有藏緬語族,被歸類為藏緬語族的語言包括藏語、彝語、緬語、羌語等,而這些語言還各可以屬於幾個不同的語支。所以,語族指的是一個語言的家族,而不是人的「民族」、「種族」、或「族群」。

「南島語系」原是歷史語言學上的概念,在廣為人知後,常被引用到許多地方,又有人會以此語系的概念,再衍生出「南島民族」、「南島語族」等稱呼。「南島語族」一詞如前所述有誤用的問題,而「南島民族」一詞其實也不無問題。

語言學家是根據同源詞以及語音對應等等線索,認定某些語言源自同一祖語,並將這些語言歸為同一語系。「南島語系」的建立,是完全靠著語言上的證據,和人無關。「南島語系」的成立,並不隱含著「講這一系語言的人是同一民族」、或「這些人在文化或體質等方面有共通性」的意味。而人的血緣、文化與語言之間對應關係經常是極其複雜的,人類學對於人的區分也有自有標準,若只是因為某些人講的語言被歸為同一語系,就將這些人直接放在一起,稱為某一民族,還以純語言學的語系名稱作為名字,其實是較輕率的做法。實際上,所謂的「南島民族」其實包含眾多各異的族群、文化,這樣多元且歧異的內容如何能在缺乏充分人類學理論的支持下,就合成一個單位呢?

所以我建議,在使用這些名詞時,不妨更謹慎一些。

本文同步刊登於符號工作站


Monday, May 15, 2006

真正的火星文:華康新篆體

華康公司有一款字體產品叫新篆體,裡面採用的是小篆的書體。對於想在設計中加入小篆的人來說,這種字體應該是極為方便的,畢竟設計者不需要懂小篆,也不必一個字一個字去查,就能馬上用打字的方式得到古意盎然的小篆字形。

問題是這新篆體還真「新」,絕大多數的字型看似小篆,實際上卻是錯誤連篇。上面我們列出華康新篆、以及字形較正確的漢儀篆書字體來做比較。看看圖中的華康篆字,「人」字寫得很像楷書的筆畫,但實際上「人」的小篆第一筆應該是從左上往右再往下,左邊再加上由上往下的一筆,而不是像華康的字一樣,第一筆變成往左下,第二筆又往右下。再舉「者」字為例,如漢儀篆書所示,正確的篆書比楷書繁複一點,且左右大致上較為對稱,而華康不僅自己發明篆字寫法,左撇和右撇還交叉在怪異的地方,右撇又特別短,實在是錯得離譜。比較兩種字體的「更」字,也可發現華康新篆的錯誤。又像「明」字,在小篆時代它的左半邊並不是「日」,然而華康卻是從現代楷書去想像小篆字形,「月」與「肉」又有混淆之虞。再看看「為」(說文作)、「書」、「女」,實在不知道還有誰比華康更會向壁虛造的了。至於「心」字,比較像少女體+兒童體的混合體,實在看不出跟篆書有什麼關係。

其實小篆在歷史上也有向後起文字妥協的記錄。漢代印章裡的小篆印文,就有很多隷化的現象。但是這些變化只限於出現在印文一類的特定領域,有特殊的結構特色,而且也有道理可循,而不是像華康一樣把火星文當競爭對手而亂改一通。如果華康非要自己發明怪字不可,那麼請把「篆」這個字從字體名稱中拿掉。

上面提到的例子只是冰山一角,華康新篆體還另有其他不勝枚舉、罄竹難書的錯誤。這樣製作品質明顯有問題的字體,要向使用者收費,卻有著嚴重的誤導作用,實在令人遺憾,也讓人質疑華康公司(現名威鋒)的專業態度與能力。

本文同步刊登於符號工作站


Tuesday, April 18, 2006

英文書中挑毛病

看過英國 DK 出版的 Eyewitness Guides 系列叢書的讀者應該都對其中精采的圖文印象深刻。基於對文字的興趣,我自己也有這系列中的「Writing」這本書,而其內容就是從古到今世界各地的書寫與印刷的介紹。不過書中還是有個關於漢字的小地方有問題,在此提出來討論看看。


如圖所示,該書作者舉出「電影」兩字,註明是「Electric + shadow = Movie」,這問題不大,當然這裡的「影」不一定非解釋為「陰影」不可,不過「電影」的確可算是一個複合詞,由「電」與「影」所構成。但其底下的解釋就有問題了:

MODERN IDEAS
Any new idea needs a new Chinese character - often a combination of exisiting characters.

這意思是任何新的概念都需要一個新的漢字,這樣的字常常是現有字組合而成的。第一句話言下之意,似乎指漢字是表意文字,所以要表達新的意思就要再造新字。這話很明顯是錯的,因為在漢字實際的應用上,新詞經常用「假借」的方式來書寫,不一定要造新字,而假借就是表音而非表意了,例如英語的「show」借入漢語寫成「秀」。至於後面說到新字常是由已有的字組合而成,這並沒有錯,但是顯然不能用來說明「電影」,因為「電影」仍是兩個字,並未組合在一起。

「電影」的例子其實是語言上的問題,它說明了現代漢語的新詞往往是結合已有的單音節詞而形成的複合詞。這是「語言」裡的構詞方式,跟「文字」的結構無關,顯然作者把語言和文字兩個範疇的問題混在一起了。

上面提到的一部份問題,其實一般懂得漢語與漢字的人也能發現,所以很容易讓這本書的內容打折扣。這提醒我們,在描述自己不很熟悉的語文時,得更小心謹慎。另外,我想書中那兩個範例文字應該可以寫得好看一點。

本文同步刊登於符號工作站