突破瓶頸高效測(cè)評(píng):谷歌提出自然語(yǔ)言生成任務(wù)評(píng)測(cè)新方法BLEURT
利用機(jī)器學(xué)習(xí)創(chuàng)造一個(gè)度量標(biāo)準(zhǔn)需要解決根本的挑戰(zhàn):這一指標(biāo)需要在不同域和時(shí)間上具備連續(xù)性。然而訓(xùn)練數(shù)據(jù)的數(shù)量總是有限的,同時(shí)公開(kāi)數(shù)據(jù)集也是稀疏的。即使目前最大的人類評(píng)測(cè)數(shù)據(jù)集WMT度量任務(wù)數(shù)據(jù)集,包含了260k的人類測(cè)評(píng),僅僅只覆蓋了新聞?lì)I(lǐng)域。這對(duì)于訓(xùn)練一個(gè)適用范圍廣泛的NLG測(cè)評(píng)指標(biāo)遠(yuǎn)遠(yuǎn)不夠。
為了解決這一問(wèn)題,遷移學(xué)習(xí)被引入了這項(xiàng)研究。首先充分利用了BERT中上下文詞語(yǔ)表示,BERT是目前用于語(yǔ)言理解最先進(jìn)的非監(jiān)督表示學(xué)習(xí)方法,并成功應(yīng)用于想YiSi和BERTScore等NLG指標(biāo)上。
其次研究人人員引入了一種新穎的預(yù)訓(xùn)練機(jī)制來(lái)提升BLEURT的魯棒性。實(shí)驗(yàn)表明直接在人類測(cè)評(píng)數(shù)據(jù)集上訓(xùn)練回歸模型十分不穩(wěn)定,因?yàn)闊o(wú)法控制測(cè)評(píng)指標(biāo)在哪個(gè)域或者哪個(gè)時(shí)間跨度上使用。其精度很容易在出現(xiàn)域漂移的情況時(shí)下降,例如測(cè)試時(shí)文本信息來(lái)自于與訓(xùn)練句子對(duì)不同的域時(shí)。同時(shí)在質(zhì)量漂移時(shí)其性能也會(huì)下架,例如要預(yù)測(cè)評(píng)級(jí)比訓(xùn)練評(píng)級(jí)高時(shí)就可能引起性能下降,不過(guò)這也是機(jī)器學(xué)習(xí)研究正在取得進(jìn)展的標(biāo)志特征。
BLEURT的成功取決于模型利用數(shù)百萬(wàn)合成句子對(duì)兒來(lái)進(jìn)行預(yù)熱,隨后再利用人類評(píng)級(jí)進(jìn)行微調(diào)。通過(guò)給來(lái)自維基百科的句子加入隨機(jī)擾動(dòng)來(lái)生成訓(xùn)練數(shù)據(jù),研究人員沒(méi)有采用人類評(píng)級(jí)而是利用了文獻(xiàn)中的模型和指標(biāo),使得訓(xùn)練樣本的數(shù)量可以低成本地進(jìn)行擴(kuò)充。
BLEURT數(shù)據(jù)生成過(guò)程,結(jié)合了隨機(jī)擾動(dòng)和現(xiàn)有的指標(biāo)和模型。
BLEURT的預(yù)訓(xùn)練分別在語(yǔ)言模型目標(biāo)和NLG評(píng)測(cè)目標(biāo)上訓(xùn)練了兩次。隨后在WMT指標(biāo)數(shù)據(jù)集上進(jìn)行了調(diào)優(yōu),下圖展示了BLEURT端到端的訓(xùn)練流程。實(shí)驗(yàn)表明預(yù)訓(xùn)練模型極大地提升了BLEURT的精度,特別在測(cè)試分布外數(shù)據(jù)時(shí)尤其如此。
結(jié) 論
與多個(gè)指標(biāo)在機(jī)器翻譯和數(shù)據(jù)文本生成任務(wù)上的比較結(jié)果表明,BLEURT顯示出了優(yōu)異的性能。例如BLEURT在2019年的WMT Metrics Shared任務(wù)上的精度超過(guò)了BLEU48%。
在WMT’19 Metrics Shared 任務(wù)上,不同指標(biāo)和人類評(píng)級(jí)結(jié)果的相關(guān)性。
研究人員希望這一指標(biāo)可以為NLG任務(wù)提供更好的評(píng)測(cè)方式,提供靈活的語(yǔ)義的評(píng)測(cè)視角。BLEURT可以為人們提供除了重合度外更好的測(cè)評(píng)指標(biāo),打破現(xiàn)有測(cè)評(píng)方法對(duì)于算法研發(fā)的束縛。

發(fā)表評(píng)論
請(qǐng)輸入評(píng)論內(nèi)容...
請(qǐng)輸入評(píng)論/評(píng)論長(zhǎng)度6~500個(gè)字
最新活動(dòng)更多
-
3月27日立即報(bào)名>> 【工程師系列】汽車(chē)電子技術(shù)在線大會(huì)
-
4月30日立即下載>> 【村田汽車(chē)】汽車(chē)E/E架構(gòu)革新中,新智能座艙挑戰(zhàn)的解決方案
-
5月15-17日立即預(yù)約>> 【線下巡回】2025年STM32峰會(huì)
-
即日-5.15立即報(bào)名>>> 【在線會(huì)議】安森美Hyperlux™ ID系列引領(lǐng)iToF技術(shù)革新
-
5月15日立即下載>> 【白皮書(shū)】精確和高效地表征3000V/20A功率器件應(yīng)用指南
-
5月16日立即參評(píng) >> 【評(píng)選啟動(dòng)】維科杯·OFweek 2025(第十屆)人工智能行業(yè)年度評(píng)選
推薦專題
- 1 UALink規(guī)范發(fā)布:挑戰(zhàn)英偉達(dá)AI統(tǒng)治的開(kāi)始
- 2 北電數(shù)智主辦酒仙橋論壇,探索AI產(chǎn)業(yè)發(fā)展新路徑
- 3 降薪、加班、裁員三重暴擊,“AI四小龍”已折戟兩家
- 4 “AI寒武紀(jì)”爆發(fā)至今,五類新物種登上歷史舞臺(tái)
- 5 國(guó)產(chǎn)智駕迎戰(zhàn)特斯拉FSD,AI含量差幾何?
- 6 光計(jì)算迎來(lái)商業(yè)化突破,但落地仍需時(shí)間
- 7 東陽(yáng)光:2024年扭虧、一季度凈利大增,液冷疊加具身智能打開(kāi)成長(zhǎng)空間
- 8 地平線自動(dòng)駕駛方案解讀
- 9 封殺AI“照騙”,“淘寶們”終于不忍了?
- 10 優(yōu)必選:營(yíng)收大增主靠小件,虧損繼續(xù)又逢關(guān)稅,能否乘機(jī)器人東風(fēng)翻身?