2010年1月5日 星期二

台灣中文語音合成軟體 為失聲漸凍人發聲

台灣中文語音合成軟體 為失聲漸凍人發聲

【大紀元6月20日報導】(中央社記者陳清芳台北二十日電)「時間簡史」的作者史蒂芬.霍金是個漸凍人,靠著眼睛操作電腦,他病而不廢,是個傑出的科學家;如今,台灣也開發出合用的電腦軟體,讓電腦能寫還能說中文,為失去行動及說話能力的漸凍人,用眼睛開一扇溝通的窗。
漸凍人劉延鑫在發病前,是電腦工程師,他發病三年多時間,從活動自如的正常人,變成四肢漸漸不能動、呼吸困難、口齒不清的病人。

他知道霍金的故事,於是在手指還能勉強操作電腦的時候,積極尋找建立的眼控軟體,美國有家公司發展出語音合成功能的眼控電腦系統;可惜,這個系統只能讓電腦說英文,劉延鑫不能靠它和家人說話。

這個時候,台灣科技大學古鴻炎教授開發了一個能同時處理中英文的語音合成軟體,劉延鑫也對電腦軟體、硬體都通;就這樣,劉延鑫在古鴻炎、逢甲大學自動控制學系林宸生教授、台灣師範大學特教系李天佑教授等的協助下,合用的中文軟體誕生了。

劉延鑫的哥哥劉延鉅說,劉延鑫雖然身體不好,腦筋卻很好,每天梳洗完畢,就開始操作電腦,一開始還能按鍵盤,兩年前,手腳不能動,呼吸吞嚥困難,原本拒絕氣管切開,因為氣切後就不能講話,最後終究是要氣切才能呼吸,他使用的電腦輔具一再升級,才能跟上病情惡化的腳步。

現在的劉延鑫可以透過眼皮的眨動、瞳孔的移動來操作電腦,讓電腦替他發聲,這個過程是他花一年多的時間,親自調整語音合成軟體的音調抑揚頓挫、速度快慢緩急,才發展出最接近人聲的合成聲音。

這套軟體是微軟視窗的WORD作業系統下,可以用注音等不同的中文輸入方式,讓手部無法操作電腦,又沒有辦法發聲的多重障礙者使用,由國人自行開發,目前硬體仍為單一來源,因此對今天能夠降低成本的空間有限。

被問到劉家到底投下多少時間、金錢才擁有漸凍人的電腦輔具,劉延鑫搖著頭說,實在算不清,也因為如此,劉延鑫和漸凍人協會發起「為漸凍人開一扇窗」行動,要募款幫漸涷人添購及教導使用電腦輔具。如果社會大眾了解漸凍人的世界,也想為「漸凍人開一扇窗」計畫出錢出力,可洽中華民國運動神經元疾病(漸凍人)病友協會,電話:(0二)二八二0一三五七,二八二0三八三九。

6/20/2004 4:40:15 PM

資料來源:http://www.epochtimes.com/b5/4/6/20/n573963.htm

語音合成(二)

簡介
•語音合成又名文句轉語音(Text-To-Speech,TTS),是指將輸入的文字或儲存於電腦中的文件模擬人聲發出語音的技術。
•語音合成較語音辨識的發展早了許多,但應用層面大多仍在閱讀電腦螢幕上的文章,語音指引,互動回饋,或輔助說明。

語音合成的作法
•頻譜參數合成方法(Articulatory Synthesis):
如Holmes的並聯共振峰合成器(1973)和Klatt的串/並聯共振峰(Formant)(1980)合成、基於LPC等聲學參數的合成系統,但要合成出清晰的語音需要準確的設定參數,使用困難,且合成出的語音仍不夠自然。
•波形拼接法(Formant Synthesis):
如基頻同步累加法(PSOLA)(1990)在語音波形上做時域(time domain)的韻律修正來合成語音,就可以產生出具有韻律的合成語音。 PSOLA的設計重點,在改良頻域(frequency domain)耗時,以及在時域(time domain)接合效果太差的情形,其合成的語音在音色與自然度都大大的提升,且架構較簡單,容易實作。

對於 TTS 系統而言,無論接受的是一段文字的輸入或是一篇文章,這些文字本身並沒有包含任何聲學特性 ( 說話的聲調,停頓方式,發音長短等韻律 ) ,只有語言學的特性,所以必須透過自動預測的機制來產生這些文字的可能的聲學特性 (acustic feature) 而所謂自動預測的機制,一般有 rule-based 跟 knowledge-based 兩種方法,但是這兩種方法不但合成的聲音平淡又缺乏吸引力且遇到連續發音或要保留語者音色時表現都不好, 因此近來串接合成法大行其道。

•串接合成法(Concatenated Synthesis):
以一個錄好聲音的語料庫來當作比對的標的,從語料庫中抓出相對應的聲音單元,一些在 rule-based 與 knowledge-based 方法下需要做細節的聲韻調整也因此減少了許多,如此簡化了計算拼接與口音等複雜的計算,也特別適合在少量字彙的輸出時使用。

語音合成的困難點
1.發音的自然度(清晰、流暢)。
2.破音字的處理。
3.即時處理的能力。

語音相關應用
1.語音合成(Speech Synthesize):運用資訊科技使電腦或電子設備模擬人聲。
2.語音辨識(Speech Recognition):讓電腦聽得懂人類說話的聲音。
1.語者相關(Speaker Dependent):不要求語者發音準確,需先經過訓練。
2.非語者相關(Speaker Independent):語者發音需較正確,且無須訓練。
3.語者識別(Speaker Identification):辨識說話者的身份

語音學(phonetics)
•在研究語音之前我們先來看看 聲音/音色(timbre)的要素:

1.頻率(frequency)
頻率是以時間為基準,振動快則頻率高,音調較為高,其衡量單位為赫茲(Hertz,Hz),一次振動是指波形從中軸往上伸延至波峰,往下跨中軸至波谷再返回中軸,稱為一個週期;頻率越高,音頻(pitch)就越高,人類耳朵可聽到的音頻範圍是20Hz至20kHz。頻率是聲波每秒振動的次數,一千赫茲(1000Hz,或稱KHz)就等於每秒鐘振動一千次,也就是每秒鐘產生一千個音波。

2.振幅(amplitude)/響度(loudness)
振幅是指音波的[振動幅度],亦可稱為[力度],影響所及是聲音波形的高低,音波的振幅愈大,則響度愈大,其衡量基準是以振幅的大小為準,以volt或dB(分貝decibe)來衡量.DB的尺度是呈指數增長的,每隔20分貝,其響度或振幅則增加10倍,例如:40分貝比20分貝的響度,提高了10倍,而60分貝則比20分貝提高了一百倍,80分貝提高一千倍之多。

•Digital Audio數位音效
音波由類比型態轉為數位型態,儲存格式方面,PC平台最常用的是WAV格式,Mac平台最常用的是AIFF格式。

•瞭解了聲音的背景之後,讓我們來解析語言的結構,語言架構大致可區分如下:
◦語言的結構[語音學(phonetics)]
1.句子(sentence)
「我是一個講國語的台灣人,雖然我的祖先來自福建,但我的台灣話說得並不流暢。」
2.子句(clause)
「我是一個講國語的台灣人」
3.詞組(phrase)
4.語詞(word)
「台灣人」
5.詞素(morpheme)
「台灣人」
6.音節(syllable)
「台」,「灣」,「人」即一般所說的字音,是聽覺上最容易分辨出來的語音單位。一般來說,一個漢字就是一個音節。漢語的音節一般是由聲母、韻母和聲調構成的;不過,有時也可以沒有聲母,只由韻母和聲調組合而成,稱之為「零聲母」。
7.音素(phoneme)
「人」是由三個音素/r/,/e/,/n/ 所形成,是最小的語音單位。
◦瞭解語言的架構可以幫助我們分析要如何發音,接下來讓我們來瞭解發音的2大要素:
1.元音/母音(vowel)
發音時,氣流會振動聲帶,在經過咽頭、口腔、鼻腔等地方時,氣流幾乎暢通無阻。由於聲帶顫動,所以聲音響亮。
2.輔音/子音(consonant)
發音時,氣流在咽頭、口腔、鼻腔等部位會受到阻礙。由於聲帶不一定顫動,所以聲音大多不響亮。
◦瞭解了發音要素後,重要的是如何讀出聲音來,我們稱之為拼音,這是會隨著國家與地區性而有所不同,我們常用的注音稱之為國音一式,通用拼音與漢語拼音還未確定誰是國音二式,而使用多年方便外國人發音的稱之為羅馬拼音(比較表),以下介紹國音的拼音的3大要素:
1.聲母(initial)=前音=子音=輔音(consonant)
發出的聲音會遭受阻礙,聲母有辨義的作用如ㄍ與ㄎ:幹什麼與看什麼,ㄋ與ㄌ:惱怒與老路
指放在音節開頭的輔音。由於聲母是由輔音充當,因此發音並不響亮,國語的聲母有21個,按發音部位分為七組。 1. 雙唇音Bilabials b(ㄅ) p(ㄆ) m(ㄇ)  
2. 唇齒音Labiodental f(ㄈ)      
3. 舌尖音Apicals d(ㄉ) t(ㄊ) n(ㄋ) l(ㄌ)
4. 舌根音Velars g(ㄍ) k(ㄎ) h(ㄏ)  
5. 舌面音Front Palatals j(ㄐ) q(ㄑ) x(ㄒ)  
6. 舌尖後音(翹舌音)Retroflexes zh(ㄓ) ch(ㄔ) sh(ㄕ) r(ㄖ)
7. 舌尖前音(平舌音)Blade-alveolars z(ㄗ) c(ㄘ) s(ㄙ)  

2.韻母(final)=後音=母音=主音=元音(vowel)
與口腔的開合有關,如ㄧ => ㄝ => ㄚ
是音節中聲母以後的部分,可以由元音 and/or 輔音充當,而且發音響亮。 1. 半元(母)音semi-vowels (y)i(ㄧ) (w)u(ㄨ) (y)u(ㄩ)  
2. 單韻母Simple Vowels a(ㄚ) o(ㄛ) e(ㄜ) ie(ㄝ)
3. 複韻母Diphthongs ai(ㄞ) ei(ㄟ)  ao(ㄠ) ou(ㄡ)
4. 鼻韻母Finals with nasal endings an(ㄢ) en(ㄣ) ang(ㄤ) eng(ㄥ)
5. 捲舌韻母Retroflex er(ㄦ)      

3.聲調(tone)
指字音的高低升降變化、國語語音高低升降、具有區別詞義作用的有規則變化就是聲調。聲正確與否是語音準確的關鍵。舉例說:國語依基頻軌跡(pitch contour)分一聲(陰平)、二聲(陽平)、三聲(上聲)和四聲(去聲)。
◦國語的音節數
依照聲,韻,調的結構,可能的音節組合有22*39*5=4290種,但國語有嚴格的聲韻組合規則,例如聲母的ㄐ,ㄑ,ㄒ後面只能是以ㄧ,ㄩ的韻母,當韻母是ㄩ時只有ㄐ,ㄑ,ㄒ,ㄋ,ㄌ的聲母,因此實際可用的國語音節約1300多個,若不考慮聲調的話只有411個。
◦拼音的組成
聲母在前,韻母在後
聲母輕短,韻母響亮
◦拼法口訣
前音輕短後音重,兩音相連猛一碰!

語音品質的評量
對於語音品質的評量,多年來人們提出了許多方法,歸納起來大致可分為兩類,即客觀評定方法和主觀評定方法。

   客觀評定方法用客觀測量的手段來評價語音編碼的質量,常用的方法有信噪比、加權信噪比、平均分段信噪比等。它們都是建立在度量均方誤差的基礎上,其特點是計算簡單,但不能完全反映人對語音質量的感覺。這個問題對於速率為16Kbit/s以下的中、低速率語音編碼尤為突出,因此主要適用於速率較高的波形編碼類型。

   主觀評定方法符合人類聽話時對語音質量的感覺,因而目前得到廣泛應用。最主要的主觀評定方法是主觀評定等級(Subjective Opinion Scale),或稱平均評定得分(Mean Opinion Score,縮寫MOS)。MOS得分採用五級評分標準,其方法是,由數十名試聽者在相同信道環境中試聽並給予評分,然後對評分進行統計處理,求出平均得分。由於主觀和客觀上的種種原因,每次試聽所得的評分會有波動。為了減小波動的誤差,除了試聽者人數要足夠多之外,所測語音材料也要足夠豐富,試聽環境也應儘量保持相同。

在這裡要特別需要說明的是,試聽者對語音質量的主觀感覺往往是和其注意力集中程度相聯繫的,因而,對應於主觀評定等級,還有一個收聽注意力等級 (Listening Effect Scale)。下表給出主觀評定等級的質量等級、分數和相應的收聽注意力等級。

主觀評定等級表 質量等級 分數 收聽注意力等級
優 5 可完全放鬆,不需要注意力
良 4 需要注意,但不需明顯集中注意力
滿意(正常) 3 中等程度的注意力
差 2 需要集中注意力
劣 1 即使努力去聽,也很難聽懂

   從用戶角度看,通常認為MOS分4.0~4.5分為高質量語音編碼,達到長途電話網的質量要求。MOS分3.5分左右稱作通信質量,這時聽者能感覺到語 音質量有所下降,但不影響正常的通話,可以滿足多數通信系統使用要求。MOS分3.0分以下常稱為合成語音質量,這種語音一般只有足夠高的可懂度,但是自 然度較差,不容易識別講話者。

   語音編碼技術標準的制定,對數位語音技術的實用化和發展起到了推動作用。

參考資料:http://159.226.2.5:89/gate/big5/www.kepu.net.cn/gb/technology/telecom/wireless/wrl216.html

語音相關專用術語
•articulatory phonetics:發音語音學(人類聲道與嘴型閉合等所發出聲音)
•acoustic phonetics:聲學語音學(聲音的物理性質)
•auditory phonetics:聽覺語音學(聽到不同語音的反應)
•phonetics:語音學
•phonology:音韻學
•phonemics:音位學
•phonetic transcription:標音
•articulation:發音
•syllables:音節
•suprasegmental features:附加音素
•allophones: 變音
•prosodic:聲韻學的(韻律學的)
•phonetic:語音學的
•phonologic:語音體系的
•phonetically:語音方面地
•semantic:語義學的
•phoneme:音素
•vocal track:聲道
•speech organs:發音器官
•acoustic:聽覺的
•consonant:子音
•co articulation:連音
•duration:音長
•intonation:語調,聲調
•juncture:連音
•verbal:口頭上的
•vowel:母音
•nasal:鼻音
•pitch:音高,指的是聲音在心理印象上的強或弱。音高常用作頻率的同義字
•utterance:言辭
•lexicon:辭典
•LPC(Linear Predict Coding):線性預估編碼,通常被當成語音訊號的特徵值
•HMM(隱藏式馬可夫模型法):在國語的TTS系統中,其文句分析必須抽取語言參數並把文字串轉換為音節串,但中文文句並沒有明顯的詞邊界,會因斷詞點不同而有不同的語意,故以n階的HMM來做語言參數的抽取。
•EGG(Electro-GlottoGraph):
•IVR(Interactive Voice Response):互動式語音回覆
•wavelength:波長,指的是在波形中,兩個連續高峰週期間的距離又稱為「樂段」(period)

聲音的格式類型
1..wav : (WAVE)Microsoft作業系統的聲音檔案格式
2..aif : (Audio Interchange File Format,AIFF)Apple發展的格式,適用於Mac與SGI
3..au : (u-law)Unix作業系統的聲音檔案格式
4.AIFC : Unix作業系統的聲音檔案格式 Audio Interchange Format Compressed
5..mp3 : MPEG Audio Layer-3 的聲音壓縮格式

免費的語音分析軟體WaveSurfer
WaveSurfer is an Open Source tool for sound visualization and manipulation. It has been designed to suit both novice and advanced users. WaveSurfer has a simple and logical user interface that provides functionality in an intuitive way and which can be adapted to different tasks. It can be used as a stand-alone tool for a wide range of tasks in speech research and education. Typical applications are speech/sound analysis and sound annotation/transcription. WaveSurfer can also serve as a platform for more advanced/specialized applications. This is accomplished either through extending the WaveSurfer application with new custom plug-ins or by embedding WaveSurfer visualization components in other applications.
Speech Filing System
SFS 4/Windows is a free computing environment for PCs for conducting research into the nature of speech. It comprises software tools, file and data formats, subroutine libraries, graphics, special programming languages and tutorial documentation. It performs standard operations such as acquisition, replay, display and labelling, spectrographic and formant analysis and fundamental frequency estimation. It comes with a large body of ready made tools for signal processing, synthesis and recognition, as well as support for your own software development.
more....

未整理資料
連續 vs. 不連續語音輸入
語音辨識技術在個人電腦上可分成語音操控及語音輸入。語音操控是用語音指令來操作電腦, 而語音輸入則是用來輸入文字。而早期的語音輸入是所謂「不連續」(discrete 或 discontinuous) 的, 也就是說, 在字與字之間是需要有短暫暫停的。而隨著個人電腦硬體性能的不斷提昇、價格的不斷下滑, 以及語音辨識技術的不斷精進, 從 1997 年下半年起, 電腦語音輸入正式進入到「連續」 (continuous) 輸入時期。

相對於不連續語音輸入, 連續語音輸入在字與字之間是不需要暫停的, 使用者可以將整個句子一氣呵成地念完。以英文的語音辨識產品來說, 最大的兩家廠商為 IBM 及 Dragon。而 IBM 公司挾著其龐大的研發及行銷資源, 也不斷開發其它國家的語言版本, 中文就是 IBM ViaVoice 產品的第八種支援語言。

國內技術發展現況
我國的語音辨識產品開發以本國語言-中文(國語)為主。國內業界以台康公司首先於1991年推出語音辨識產品「捷通」語音輸入系統,包括中文語音聽寫、中文語音指令、中文語音合成等功能。倚 天公司亦於1994年發表「話匣子」語音辨識產品。兩者均屬特定人、單字音辨識的產品,辨識率不如理想。不如理想。此外,國科會 的產學合作計畫亦有多家廠商參與,台大/中研院的「金聲」系列 國語聽寫機參與廠商有倚天、明碁,成大的「音中仙」中文詞輸入系統有台康、技電、旺宏等。華隆微電子亦曾推出小詞彙(20-40詞) 語音辨識晶片(型號:HM2007)。 1995年11月蘋果電腦宣布其「中文聽寫工具」,屬特定人、單詞辨識的產品;宏碁於1995年九月推出 的「渴望」多媒體家用電腦也搭配不特定人、小詞彙的英文語音指令控制功能。最近許多廠商對中文語音電腦及語音辨識晶片的開發 均表示高度興趣。以生命期而言,語音辨識產品尚處於萌芽起步階 段,市場成長率高。 語音辨識技術的發展,在歐美等先進國家由來已久,我國在這項 技術的發展,早期以學術界為主,始於台大的國語聽寫機(1983年 )研究計畫,清大、交大、成大等亦均投入研究多年。交通部電信 研究所亦有偏重電信應用的語音辨識技術研發。經濟部科技專案亦 於1991年起支持工研院電通所投入中文語音辨識技術的研發,在基礎技術及實驗環境建立之後,於1992年七月起於「前瞻性資訊技術 研究計畫」成立一子計畫,1993年完成中文語言模型設定及硬體系 統功能設計, 1994年完成在工作站之一特定人、大詞彙、單字音之國語聽寫機雛型系統整合,1995年完成以分段機率模型開發之不特 定人、中詞彙、單字音組詞辨識技術,1995年12月資訊展展出”PC 版非特定語者中文語音辨識系統”,為不特定人、中詞彙、連音詞 辨識技術(系統流程如圖一),正繼續研發語者調適、噪聲模型、麥 克風調適、標準應用程式介面、進一步提高辨識率等技術,使該技 術可以實用化、商品化,由「能用」逐漸走向「好用」、「到處可用」、和「隨時可用」的境界。另一方面,工研院電通所也同時投 入特定人、小詞彙語音辨識晶片的開發,主要為協助半導體廠商進 入消費性電子所需的語音辨識晶片領域。此外,也將開始語音合成及壓縮技術的發展

國外相關研究研究
單位 產品
AT&T Bell Labs Bell Labs TTS
BT Labs Laureate
Entropic Truetalk
Microsoft Research Whistler
Lernout & Hauspie TTS3000/M
Lucent Next Generation Speech
CSTR University of Edinburgh Festival
ETI-Eloquence ETI-Eloquence
Lernout & Hauspie Realspeak
Elan informatique Elan Speech Engine
香港中文大學人機通訊實驗室 CU VOCAL 「悠揚」語音合成系統

國內相關研究研究
單位 簡介
台大李琳山教授
相關資料 金聲一號二號三號等聽寫系統、文字轉語音系統、對話系統、語音為基礎之資訊檢索系統等。
主從式架構、網路之語音介面、隨網路資源調適之詞典和語言模型、網路語料處理、無線環境下之分散式語音處理等。

清大王小川教授 連續三年的國科會計畫「國語語音資料庫之設計與建立(MAT計畫)」(1995-1998),完成約7000人之電話語音資料收集,這是國內首次大規模的語音收集,目的在建立一個研究環境,提供國內語音處理技術研發工作者一套語音資料庫。其中資料檔之編輯程式(取名為Veditor3.0)已登記著作權。部分語音資料陸絨委託中華民國計算語言學學會發行,MAT-160、MAT-400、MAT-2400已提供學校及研究單位使用,其中MAT-2400則由國科會辦理技術移轉。
成大王駿發教授 用於根據一倒頻譜係數運算式來處理線性預測係數之以線性預測係數為基礎的倒頻譜係數產生器
語音編解碼方法及語音編解碼器
交大陳信宏教授 使用韻律訊息之類神經網路國語連續語音辨認
不特定語者國語連續音節辨認技術之探討
適合視障者使用之電腦界面技術與系統設計-子計畫二:盲用電腦之國語單詞輸入及語音輸出系統之發展
中研院許聞廉教授 中文同音字的自動辨認;中文字轉音以及語音合成系統;語音辨認的後處理(音轉字以及容錯系統);OCR、OLCR的後處理系統;各類自形輸入法同碼字的
自動選取系統;中文句型剖析(PARSING)以及斷詞系統等。
台大陳信希教授 1. 剖析系統
2. 線上即時英文翻中文服務系統
3. 臺灣本土語言互譯及語音合成系統
4. 中文斷詞及人名、組織名辨識系統
5. 多文件新聞自動摘要系統
台科大古鴻炎教授 增進參數獨立控制之彈性、並可產生豐富音色之國語音節信號合成方法
可作動態音色變換之 國語 語音合成 軟體"
客家語(Hakka)語音信號合成
整合動態詞典與馬可夫中文語言模型之方法
長庚呂仁園教授 「國台雙語語音辨認自動掛號系統」以及「台語文字轉語音(語音合成)系統」
台灣地區多語語音資料庫之建立
語音電話掛號總機

語音相關的中文書籍
1.楊鎮光,"Visual Basic與語音辨識-讓電腦聽話",松崗,2002。
2.林寰生,"數位信號-影像與語音處理",全華,1999。
3.謝秀琴,"數位語音訊號基本原理",全華,1996。
4.劉振源,"類神經網路模型與語音識別",全華,1995。
5.王仁華,"人機語音通信",聯經,1995。
6.許志興,"聲霸卡之應用與語音辨識",旗標,1994。(朝陽圖書館有藏書)
7.陳明瑩,"PC電腦語音辨認實做",旗標,1994。(朝陽圖書館有藏書)
8.黃嘉華,"聲音與多媒體PC",全華,1994。(朝陽圖書館有藏書)
9.許雍,"微電腦應用-語音處理",全華,1993。(朝陽圖書館有藏書,偏IC設計,探討midi較多,資工資科電子背景較適合)
10.吳明哲;黃世陽,"VB4.0動畫與語音技巧秘笈-使用物件導向程式設計",松崗,?。

網路資源
1.語音研究應用軟體
2.注音符號簡介
3.Pin-yin
4.大陸的人機語音交互科研組(TTS)
5.語音合成技術的原理
6.大陸的語音合成相關網頁
7.Speech Synthesis & Analysis Software
8.中央研究院語言學研究所籌備處語音實驗室
9.音頻視訊格式介紹
10.吳志勇博士
11.陳永承 Evan Chen
12.Examples of Synthesized Speech
13.Speech Analysis Tutorial
14.Pitch Analysis

摘自: http://irw.ncut.edu.tw/peterju/speech.html

語音合成軟體

國立臺灣大學資訊工程學研究所自然語言處理實驗室

臺灣本土語言互譯及語音合成系統

國內是多語並存的社會,國語、台語、客語、原住民語是我們平常使用的語言,在不同語言文化的保存極為重視的時代,如何運用資訊技術處理本土語言是我們的責任。國立台灣大學資訊工程學系陳信希教授運用國科會計畫所開發出來的語言處理技術,設計一套本土語言互譯及語音合成系統,使用者以中文輸入,可以國語語音、台語語音及客語語音輸出,這對國內不同語言之學習及溝通有大的助益。
  
您在進入本土語言互譯及語音合成系統,輸入想要翻譯的中文詞或句子以後,可以勾選要聽聽國語、台語還是客語的說法,每一種語言又會有不同的選項。輸入並選擇完成後,按下「傳送」以後,系統就會用該語言的翻譯結果呈現在網頁上。翻譯結果的網頁上還有一個播放聲音的按鈕,按下去後就可以聽到這句話的發音,這是語音合成的結果。

http://nlg.csie.ntu.edu.tw/systems/TWLLMT/

語音合成(ㄧ)

語音合成

維基百科,自由的百科全書
(重定向自語音合成)

語音合成是將人類語音用人工的方式所產生。若是將電腦系統用在語音合成上,則稱為語音合成器,而語音合成器可以用軟/硬體所實現。文字轉語音(text-to-speech, TTS)系統則是將一般語言的文字轉換為語音,其他的系統可以描繪語言符號的表示方式,就像音標轉換至語音一樣。

而合成後的語音則是利用在資料庫內的許多已錄好的語音連接起來。系統則因為儲存的語音單元大小不同而有所差異,若是要儲存phone以及diphone的話,系統必須提供大量的儲存空間,但是在語意上或許會不清楚。而用在特定的使用領域上,儲存整字或整句的方式可以達到高品質的語音輸出。另外,包含了聲道模型以及其他的人類聲音特徵參數的合成器則可以創造出完整的合成聲音輸出。

一個語音合成器的品質通常是決定於人聲的相似度以及語意是否能被了解。一個清晰的文字轉語音程式應該提供人類在視覺受到傷害或是得到失讀症時,能夠聽到並且在個人電腦上完成工作。從80年代早期開始,許多的電腦作業系統已經包含了語音合成器了。

資料來源:
http://zh.wikipedia.org/zh-tw/%E8%AA%9E%E9%9F%B3%E5%90%88%E6%88%90

2009年10月13日 星期二

精神分裂症患者的內在世界

ㄧ、感官知覺的改變:
 感官知覺的改變在精神分裂症的早期階段特別明顯,據研究約有2/3的病人有此變化,所有的感覺受器會變得強烈或鈍化。

(1) 聽覺方面的變化,如下面病人所描述的: ”我聽到所有天堂與地球上的聲音””我聽到許多在地獄的聲音””好像有人把所有東西的音量都轉大聲了,我會注意到所有背景的聲音” ”雖然我不特別對任何事情注意,但所有的事情都會住我的注意力,當我現在對你說話時,我可以聽到隔壁房間及走廊聲音,我無法不注意他們, 所以我無注意我在對你說什麼,時常連一些最無聊無趣的事都會吸引我,讓我花費許多時間在上面”

(2) 視覺的變化甚至比聲音的變化還明顯,如下面的描述 ”東西都變得更鮮艷清楚了,彷彿是發光的圖畫般,而且看起來較扁平,好像只是一個平面,並且不止這些顏色吸引我的注意,所有小東西都會讓我注視很久,像邊緣的線條等等” ”每件東西看起來都很可怕,人們看起來像魔鬼-有黑色的輪廓及發亮的眼睛,所有的物體-椅子、房子、東西都有自己的生命”,”他們有威脅的姿態,及動物般的外觀” ”人們看起來是變形的,好像經過整形手術””人們看起來像橡皮做”  

(3) 除了聽覺、視覺的變化以外,觸覺也可能有改變: ”被接觸是很可怕的,和任何人接觸都會讓我覺得像被電到般 ”我感覺喉嚨中似乎有一隻老鼠,而且衪的身體好像在我嘴巴中解體 有位醫生描述他的病人覺得他的生殖器不斷的變黑,而產生妄想性的恐 懼,而要求醫生每分鐘檢查一次因為知覺過度敏感化,病人會被外在的刺激所淹沒,他們會看到、聽到所有的事情,正常的人,我們的腦筋會自然過濾影像及聲音,讓我們可以集中注意力在我們選擇的事物上,精神分裂症病人的過濾系統損壞,以致所有外界的感官刺激如洪水般,同時作用在大腦上.
 
二、對了解訊息及作反應發生異常
正常人的腦部功能可以對外界進入的訊息加以分類及了解,然後選擇性做出正確的反應,這些反應是學習累積而來,有邏輯性並且可以預測其後果.精神分裂症患者對於訊息的分類、了解及反應發生缺損,所以不止思考發生問題,而且在視覺、聽覺刺激、情緒及行為反應上都受到影響,就好像腦部的總機出了問題,無法將進入的訊息、思考、想法、記憶、情緒做適當分類,而完全混合在一起. 例如正常人可以將聽到的句子自動轉換成想法,我們不需要集中在個別的字上,只要去想這整個句子的意思就好,但是對病人來講,如他們所描述的: [如果人們講得比較簡單,我還可以集中注意力,但如果句子過長,我就無法了解意思; 對我來講那只是一堆字,我必須要努力的把它拼湊起來,這必須要花費我很大的功夫,他們講的話彷彿就像外國話一樣,我無法了解他們在說什麼.]不止聽覺如此,在視覺上也是一樣,如下面病人所描述的: [每一件事情都裂成碎片,我必須要努力的把它們組合起來,譬如我看到手錶時,看到是一個錶帶、錶面、針,我必須努力的去想,才能了解這是一個手錶].又如另外一個病人描述他看精神科醫師的經驗,他看到是牙齒、鼻子、下巴、眼睛及各個部位,各個部位都讓他感覺到非常害怕,他無法認得他是什麼人. 這種對視覺了解上的缺損,常見在精神分裂症患者,他們會把人認錯,而且說看起來像某些人. 例如一位病人所說:[今天早上我在某家醫院,我好像在拍電影,我看到我週圍都是明星.] 除了以上的問題,精神分裂症病人常無法同時處理兩種以上的訊息. 譬如病人說:[我沒辦法看電視,因為我沒辦法一面看螢幕,又同時聽電視上的韾音.] 這種看電視的困難是很典型的,所以在精神病院來講,很少會看到病人一直坐著看電視;有時候他們坐著看電視,也無法描述看到的是什麼. 這種情形與病人的智力教育程度無關,甚至有些大學畢業的病人也沒有辦法. 如果你問他為什麼不看電視,他會告訴你他無法了解在演什麼.或者他們為了掩飾這種缺失,會告訴你他累了,不想看電視,他們比較能接受的節目是卡通或旅遊性節目,因為這些只是單純視覺上的刺激,不需要去整合聽覺與視覺.

除了對訊息的分類及了解有缺失外,另外很明顯的是對刺激作反應也出了問題,常常做出的是不恰當的反應. 因此精神分裂症病人,在與其他人的相處上也會發生問題,很多病人寧可獨處、退縮,儘量少與其他人交談、溝通,因為這些過程對他們來講是困難而且痛苦的,他們會儘量去避免.

精神分裂症病人在語言表達上的問題包括:

音韻連結:病人只注意到聲音的部份,忽略了字的意義.

抽象思考障礙:當問病人成語時,病人只注意到字,無法去了解整句成語的意思,譬如成語“住在玻璃屋中的人不應該向他人丟擲石頭”,病人便只會注意到玻璃屋及石頭,而去描述什麼樣的玻璃屋及什麼樣的石頭.

新語症:如病人所描述的:[我想說的無法表達,在我的腦筋好像發生了障礙,沒有辦法正確地說出我想表達的,有時候我隨便找個字來代替.]

而更極端的例子的是就是語言沙拉:病人所表達出來的是完全無意義而不連貫的字.

另外一個常見的症狀是思考中斷,就好像腦子裏面的總機,突然斷電停了好幾秒鐘,然後又再繼續運作,如病人所描述的:[當我思考到一半,會突然停在一個字或者想法上而沒有辦法運轉下去,整個腦袋沒有辦法再想到任何的事情.] 另外一個病人描述的是:[當我在讀書的時候,突然被某個字陷入泥沼裏,好像被催眠了,這個字把我吸住,而我沒辦法再思考下去.]
另一個常見的症狀是矛盾,病人無法處理腦子同時出現兩種相反的思考、感覺,如病人所述:[對各種事情我的腦子都出現兩種對立的想法,所有想法都是相互矛盾,之後整個腦筋彷彿成了碎片,整個人被解體了.]

因為這些對刺激分類、了解及反應的問題,精神分裂症病人在正常人看來便是語無倫次無法了解,沒有邏輯性,思考障礙及退縮等.在這種情況下,病人的判斷力受到損傷,在疾病早期,以上這些症狀是模糊而不明顯的,但是隨著疾病程度變得嚴重,這些缺失變得越來越明顯. 每個精神分裂症病人,多多少少都具有以上某些症狀. 

三、幻想和妄聽
幻聽和妄想是精神分裂症最常見,也是最著名的症狀,大部分的幻聽和妄想是因為病人對外界事物的感覺發生扭曲而造成的. 妄想是病人所出現的錯誤想法,而且對其所處的風俗習慣、文化來講是不正確. 通常妄想來自於病人對所接受到感覺加以錯誤的解釋,把周邊各個不相關的事情聯想成與自己有關,譬如當你走在街上,對街有一個人咳嗽,你可能都沒有感覺,也不會注意到他. 但是對精神分裂症病人來講,他不止可以聽到咳嗽,而且馬上聯想這個咳嗽是針對他,對他有某種特別的含意,然後又聯想到這個咳嗽是在警告另一個人,告訴他說病人來了,在這種情況下,如果你嘗試跟病人理論,告訴他沒有什麼事情發生,但病人仍然可能認為你跟他們是一夥的,只是要來掩飾這個事情.所以由於病人對一些感官知覺的過度敏感,對邏輯推理事情的能力受到影響,這些情形綜合起來便可能造成病人的妄想。

被害、被監控、被攻擊的妄想是最常見的,一些病人可能因為自衛的理由,而攻擊他人,但畢竟在所有精神分裂症病人來講,還是佔少數。

另外常見的是誇大妄想,例如病人覺得有力量去控制天氣,可以控制太陽及其他星球的運動, 或認為自己是耶穌基督. 如下面病人所述:[我覺得我是個明星,我正在拍片,每次我到達一個地方就有隱形的照相機及麥克風記錄我所有的事情、說話及動作,他們都在為我拍片.] 誇大妄想有時候也會是危險的,如病人覺得他可以飛,便可能造成意外.有一種特別的誇大妄想,通常是覺得有名的人愛慕及追求他,譬如有的病人會覺得有個非常有名的政治人士愛慕他,花了所有的時間及金錢追蹤他的行動,但保持一定的距離. 他也有一套理由來解釋為什麼那個人不敢讓他知道在追蹤他的行動. 另外有的病人覺得他有能力控制他人的心理,譬如有一位女病人他五年不敢走出家門,因為她覺得如果她走上街去,她會影響其他人的心靈,他們全部都會注視他,他就像一個磁鐵,其他人沒有人辦法,一定要轉來注視他。

另外一個典型症狀是思考傳播,病人覺得他腦中的想法會被傳播出去

妄想有時是固著的,有時是起伏不定的,譬如有的病人會認為某甲要殺他,在第一天他可能與某甲保持距離,敬而遠之,卻在第二天又與某甲愉快地交談,在第三天又開始對他保持距離。
病人的幻覺可以從對視覺的過度敏感化到真正的幻覺出現,當視覺過度敏感化,病人看到光線覺得特別亮,特別鮮艷. 再進一步出現的是錯覺,病人對視覺的訊息產生扭曲,譬如把狗看成老虎. 更嚴重的便是真正的幻覺,病人在沒有任何外在刺激的情況下,覺得看到、聽到、感覺到、聞到或吃到一些東西. 這些經驗對病人來說是非常真實的. 所以我們可以看到病人自言自語,對著他所聽到的聲音說話. 聽幻覺是最常見的幻覺,他們可能是簡單的聲音,或重覆的一句話,甚至聽到多人在交談,而且整天持續. 幻聽最常見的時間,大部份是在睡覺前, 內容通常是指責性,責罵病人的,有時候是一些髒話,病人可能不好意思告訴醫護人員; 也有些病人聽到是愉悅的聲音.幻聽的機制不明,腦部有很多部份負責聽覺功能, 有人認為在靠近顳葉及額葉的聽覺功能因為血流量增加而造成幻聽,而有的人認為是大腦皮質的語言區出了問題. 有趣的是有些天生耳聾的病人也會有聽幻覺. 值得注意的是在評估妄想與幻覺時,要根據病人的文化背景。如某些宗教團體有出現視幻覺的情形,一般來講,宗教的幻覺較常出現視幻覺, 且常常是具有指示性,引導性, 且較愉悅的. 而精神分裂症病人以聽幻覺較多. 另外更少見的是嗅幻覺,味覺幻覺, 如有一位病人在未婚懷孕時,用奎寧來作流產,這件事讓她覺得有罪惡感,以後只要當她想到墮胎的事情時便會聞到奎寧的味覺。

四、對自我的感覺改變
正常人對自己的身體有清楚的概念,知道自己的手腳在那裏,可與其他外界事物分別,而精神分裂症病人常常覺得自己的身體起了變化,例如會覺得身體的骨架扭曲或覺得前額的流海變得非常多而且重,引人注意; 或覺得自己的眼睛顯得空洞,而且深陷在頭骨中; 或四肢顯得形狀非常怪異,變得比較小或比較細長或放在錯誤的位置; 或自己的臉看起來似乎有二倍長; 或覺得自己身體的每一部分有自己的生命,變得解離.譬如病人覺得他的膝蓋在搖動,他的胸部隆起好像一座山,身體各個部分分開了,手跟腳裂成不同的部位. 如病人所說:[“我必須要檢查才知道我的手是不是還放在口袋裏面”],這些都是病人對自己的感覺受器出了問題.

另外是自己與他人的界限混淆,例如病人覺得媽媽已經喝了一杯茶,他便不該再喝茶.又有病人描述:[“我看到夜班的護士走進病房,突然了解他就是我,我正從另外一個角度來看自己”].,又如另一位病人描述“[當我解小便的時候,整個世界都下起雨來了,我突然覺得非常害怕]”。

性別的混亂也並非少見,如一位男病人描述,他的胸部漸漸隆起,只要經過的人都可以看得到,這些對自我感覺的改變可能隨著妄想及幻覺的連結而更加嚴重,如病人說:“我一早醒來發現自己已經被變成一隻蜜蜂了”。

五、情緒的改變
精神分裂症早期的病人可能變得憂鬱、害怕及情緒起伏,但到了疾病末期,情感會變得鈍化,沒有辦法感覺情緒
. 憂鬱的情緒在疾病的早期是非常常見的,病人常覺得在妄想及幻聽之前他們先經歷到憂鬱的感覺,大部分這些憂鬱是生理性的,有些也可能來自於病人了解自己生病所造成的次發性憂鬱。

另外在疾病的早期,病人可能經歷到各種情緒都變得非常強烈而且轉變得非常快,好像宗教的狂喜般,病人覺得他所有的問題都沒有了,所以的願望都將會被滿足; 有時會覺得身體被一種溫暖所包圍. 另外有時病人覺得自責,或感到害怕,這種害怕是沒有原因,而且沒有確切目標. 如病人描述:[“我坐在地下室裏,害怕得無法控制,就連一隻蒼蠅也會讓我害怕不已”]. 除了對自己的情緒感覺控制出了問題,病人也無法正確評估他人的情緒, 無法對別人的情緒及適當的反應,因此對病人的社交技巧及交友會造成困難. 病人這些情緒異常可能與前面所描述的腦中的總機發生問題有關,病人經驗到錯誤的訊息, 表現出來的便是錯誤的情緒. 如病人描述:[當我在談話時,腦中常同時進來許多其他的訊息,對方談的是非常悲傷的事情,但是卻有非常可笑的事情在我腦海中,使我發出不適切的笑.] 另外病人情緒變得淡漠,無法對別人有同理心,而且這種情緒淡漠隨著疾病進程越來越明顯。

六、動作的變化
精神分裂症病人的動作常常會變得緩慢,有點笨拙,這不一定是藥物的副作用,疾病的本身就可能造成這種變化. 他們在行走時手部的自然擺動會減少,有時眨眼的情形也會減少,最嚴重的情況就是所謂的僵直型精神分裂症,病人可保持數個小時維持同一個姿勢.

七、行為的改變
行為的改變通常來自於其他症狀的影響,如病人對外在刺激過度敏感化,無法統合這些刺激,病人會退縮在角落,或保持身體不動. 有時候,這種退縮是因為病人深陷在他的思考世界中,或者有時是為了減緩外界刺激進入腦中的速度.

如下面的病人描述:[我覺得如果我動作得較快,世界彷彿要分解了,所有的事情好像混合在一起, 變成一團混亂,我沒有辦法分辨出各個情況;而如果我完全不動保持這種姿勢,事情似乎就變得比較容易了解。]

另外一個造成病人行動遲緩的原因是發生了不可預期的感官刺激. 如下列病人所描述的[“我突然好像被催眠了,因為發生了很可怕的經驗,突然有一個很大的聲音,就好像有人把一個巨大的收音機突然轉開了,這些聲音使我停下所有的活動.]

另外常見的是儀式化的行為,如病人有時會重覆繞圈走,或不斷地進出同一個門,如下面一位女病人描述她作蛋糕時發生的情形:[當我作蛋糕作到一半時,蛋糕的材料都突然發生了變化,東西都有了特殊的意義,我發現打蛋的時候必須要以順時鐘的方向,在某個時刻我必須要站起來面向東邊,蛋白必須由左向右倒入,每件事情突然都有很複雜的意義,我並不了解,但是我必須照著做. ]

另外有些特殊的行為在別人看來是怪異的,但對病人來說卻是重要的. 例如有個病人由左向右有韻律地搖頭,表示這樣可以將某些思考由他腦中搖晃出去,幫他清掉不想要的想法,有時這種行為會被錯認為強迫性行為.

另外的情形是所謂的語言模仿及行為模仿. 語言模仿是指病人像隻鸚鵡般重覆別人的話。有些人認為病人重覆這些話是為了解吸收這些話的意思. 病人模仿他人的動作稱為行為模仿,有些人認為病人用這個方法來分辦自己與他人的界限. 所以病人的行為對其本身來說是合邏輯的,只是在外人看來卻是瘋狂的. 例如有位病人連續打破護士的二副眼鏡,病人解釋說我覺得醫生和護士要害我,護士配戴眼鏡就是把光反射到我身上來陷害我,所以我必須要把她的眼鏡打掉.] 甚至更怪異的行為如當眾脫衣服,病人的解釋是她想要變得純潔。

病識感是指病人是否了解他們的腦部功能出了問題. 有些病人在疾病的初期會告訴周圍的人,他的腦筋似乎怪怪的. [“我不知道腦子發生了什麼事情,一切好像都跟以前不一樣了”].有位十幾歲的病人知道他腦筋出了問題,花了好幾個月的時間在醫學圖書館查有關的資料,但是當疾病變得嚴重時,這種病識感也減少了,因為腦部功能的缺損越來越嚴重,病人已經比較沒有辦法合理去思考,但令人驚奇的是仍有不少病人具有病識感. 譬如一位年輕患者說:“我寧願失去我的手臂來換回我以前的頭腦“. 我們可以來想像病人發生的狀況,他們的感覺發生改變,他們沒有辦法了解訊息的意義,有妄想和幻聽出現,身體的界限也出了問題,情緒和行都沒有辦法控制. 想像一下當你沒有辦法信任你的腦袋會是什麼狀況. 如一位病人所描述的,我們的腦筋是故障的, 可是我們必須用這個故障的腦來評估自己與世界,所以病人常有憂鬱的情緒是很可以理解的.

另外一個了解病人世界的方法是觀賞一些藝術品及繪畫,譬如很有名的梵谷的畫. 當我們對病人的內在世界更加了解,會對他們有同理心,知道如何去幫助他們.

資料來源:http://www.psychpark.org/psy/inner%20world.asp
白雅美醫師 ymbi@ms1.hinet.net
~摘譯自Surviving Sdizophrenia by E. Fuller Torrey, M.D.

輕聲(二)

輕聲的長短

趙元任先生(1968)的國語聲調簡表裡,認為陰平、陽平、去聲都是佔四個節拍的,上聲是佔第五個節拍的,半上也是四個節拍的,而輕聲只佔了兩個節拍,所以聲音縮短,弄得四聲模糊。

輕聲當一句話開頭的例子不多,所以說輕聲的音高是不高不低,可以算是「中」;在1,2,3,4,5音高裡,可以算是3

可是平常有四聲的詞素,在好些場合也失掉了固有的聲調,讀成輕聲的,比方「牌坊」的「坊」不讀陰平,「出來」的「來」不讀陽平,「奶奶」的第一個「奶」不讀上聲,「板凳」的「凳」不讀去聲,而全讀輕聲,那麼所有的那些詞素結構,就複雜一點了。這樣,把輕聲設立成聲調裡的第五個音位;陰、平、上、去、輕,任何音素都有兩個同位音(allophone)的可能了。當然我們要講輕聲語源,要從歷史上講起,像現有的輕聲字,了、子、、、、、、差不多百分之九十九以上的詞素都是本來有陰、陽、上、去四者之一的,只有極少數幾個助詞,單呼詞,詞尾是沒法子知道它輕聲以外的調類。

資料來源:華語語音學 語音理論-(上篇) 葉德明著

2009年10月6日 星期二

輕聲(一)

輕重音在華語裡面,因為它影響聲調,所以在標準華語裡設立一個輕聲。輕重音在華語裡,是音高音長的變更,在華語中具有語意的功能.其作用如下:

調節語氣:能使音調產生抑、揚、頓、挫,高、低相襯,長、短相輔,擔任言語中音調變化區別語意的作用。

用以辨別詞意:輕重音能使詞彙在句子中的意義更加明顯適用。
例如:蓮子-簾子,下麵-下面,蝦子-瞎子

輕聲與輕讀
一個句子中除了有特別強調的重音之外,其他的音相對的就有輕讀或輕聲的現象。所謂輕讀是與重音比較出來的,在句子中不加重的音都比較輕一點,例如:他是誰?重音落在「他」,「是誰」就輕讀。而比輕讀更輕的聲音我們稱它是「輕聲

輕聲的定義:當我們說話的時候,把一個詞尾,說的調型模糊,音長縮短了,就產生了輕聲。因此輕聲是說的又快又模糊的調,它有沒有自己原來的調值和調長,卻是值得研究的問題。

從前的語言學家,常認為華語是單音綴語的。那常是受到了方塊漢字的影響;以為一字一音,一音一義,單獨存在,單擺浮擱,不相連屬的。直到白話文在口語流行以後,許多學者才覺得漢字雖然是單個方型的,而應用的詞語卻多是複音的(從古至今流傳的複音)。而且這些複音連綴一起,成了詞語,在音調上更有抑、揚、頓、挫、緩、急、輕、重的配合,並非平鋪直敘,按字讀音,要是,我們聽外國人剛學華語的時候,說話或讀書,都是沒輕沒重,按字讀出聲音來,讓我們一聽,覺得不但很怪,而且意思也不明白。甚至我們國人說話或演講的時候,把「的」「了」「著」「呢」「嗎」也照讀書音說出來,不注意輕聲的使用。

其實有些輕聲字有它原來自己的調,有些輕聲字在口語相傳,約定俗成的語境中,已經成為固定的輕聲字,輕聲字在華語中有沒有調?聲音的高低又是怎麼呈現的?有關這兩個問題,已有語音學家趙元任先生等人做過實驗,測量出它的高低與長短,輕聲字的高低,是靠它前頭那個字音的高低來決定的。

輕聲的調值
「青的」的「的」(调值2)跟「黃的」的「的」(调值3)多一樣高,「紫的」的「的」(调值4)高一點兒,「綠的」的「的」(调值1)

看前頭的音的高低是怎樣,它就多高。所以這個輕聲,可以算是一個音位下的不同的幾個音位

資料來源:華語語音學 語音理論上 葉德明著