什么是文本摘要?為什么要有注意力機(jī)制?
什么是NLP中的文本摘要
自動(dòng)文本摘要是在保持關(guān)鍵信息內(nèi)容和整體含義的同時(shí),生成簡(jiǎn)潔流暢的摘要的任務(wù)。 文本摘要目前大致可以分為兩種類型:
Extractive Summarization:重要內(nèi)容、語(yǔ)句提取。
Abstractive Summarization:文本總結(jié)。
Extractive Summarization
由圖可以看出,這種方法提取的內(nèi)容語(yǔ)句來(lái)自于原文。
Abstractive Summarization
由圖可以看出,這種方法提取的內(nèi)容語(yǔ)句可能不存在于原文。
Seq2Seq模型
Seq2Seq模型可以處理一切連續(xù)型信息,包括情感分類,機(jī)器翻譯,命名實(shí)體識(shí)別等。 機(jī)器翻譯任務(wù)中,輸入是連續(xù)文本序列,輸出也是連續(xù)文本序列。 命名實(shí)體識(shí)別中,輸入是連續(xù)文本序列,輸出是連續(xù)的標(biāo)簽信息。 所以,我們可以利用Seq2Seq模型,通過(guò)輸入一段長(zhǎng)文本,輸出短的摘要,實(shí)現(xiàn)文本摘要功能。 下圖是典型的Seq2Seq模型架構(gòu):
通常我們可以選擇RNNs網(wǎng)絡(luò)的變體GRU或者LSTM,這是因?yàn)樗鼈兡軌蛲ㄟ^(guò)克服梯度消失的問(wèn)題來(lái)捕獲長(zhǎng)期依賴性。
Encoder編碼器
LSTM中的Encoder讀取整個(gè)輸入序列,其中每個(gè)時(shí)間step上,都會(huì)有一個(gè)字輸入編碼器。然后,他在每個(gè)時(shí)間step上處理信息,并捕獲輸入序列中存在的上下文信息。
上一個(gè)時(shí)間step的隱藏層h1與記憶單元層c1將會(huì)用來(lái)初始化Decoder。
Decoder解碼器
Decoder是LSTM結(jié)構(gòu)的另一部分。它逐字讀取整個(gè)目標(biāo)序列,并以一個(gè)時(shí)間步長(zhǎng)預(yù)測(cè)相同的序列偏移量。 解碼器可以在給定前一個(gè)單詞的情況下預(yù)測(cè)序列中的下一個(gè)單詞。解碼器的初始輸入是編碼器最后一步的結(jié)果。
在將整個(gè)目標(biāo)序列放入解碼器前,還需將[start] 與 [end]這兩個(gè)特殊的tokens加入序列中,告知模型的開(kāi)始與結(jié)束。模型通過(guò)輸入的[start]開(kāi)始預(yù)測(cè)第一個(gè)詞,而[end]則表示整個(gè)句子的結(jié)束。
Deocder的工作流程
假設(shè)輸入序列為[x1,x2,x3,x4],將其編碼成內(nèi)部固定長(zhǎng)度的向量。 下圖顯示了每一個(gè)time step下Decoder是如何工作的。

發(fā)表評(píng)論
請(qǐng)輸入評(píng)論內(nèi)容...
請(qǐng)輸入評(píng)論/評(píng)論長(zhǎng)度6~500個(gè)字
最新活動(dòng)更多
-
3月27日立即報(bào)名>> 【工程師系列】汽車電子技術(shù)在線大會(huì)
-
4月30日立即下載>> 【村田汽車】汽車E/E架構(gòu)革新中,新智能座艙挑戰(zhàn)的解決方案
-
5月15-17日立即預(yù)約>> 【線下巡回】2025年STM32峰會(huì)
-
即日-5.15立即報(bào)名>>> 【在線會(huì)議】安森美Hyperlux™ ID系列引領(lǐng)iToF技術(shù)革新
-
5月15日立即下載>> 【白皮書】精確和高效地表征3000V/20A功率器件應(yīng)用指南
-
5月16日立即參評(píng) >> 【評(píng)選啟動(dòng)】維科杯·OFweek 2025(第十屆)人工智能行業(yè)年度評(píng)選
推薦專題
- 1 UALink規(guī)范發(fā)布:挑戰(zhàn)英偉達(dá)AI統(tǒng)治的開(kāi)始
- 2 北電數(shù)智主辦酒仙橋論壇,探索AI產(chǎn)業(yè)發(fā)展新路徑
- 3 降薪、加班、裁員三重暴擊,“AI四小龍”已折戟兩家
- 4 “AI寒武紀(jì)”爆發(fā)至今,五類新物種登上歷史舞臺(tái)
- 5 國(guó)產(chǎn)智駕迎戰(zhàn)特斯拉FSD,AI含量差幾何?
- 6 光計(jì)算迎來(lái)商業(yè)化突破,但落地仍需時(shí)間
- 7 東陽(yáng)光:2024年扭虧、一季度凈利大增,液冷疊加具身智能打開(kāi)成長(zhǎng)空間
- 8 地平線自動(dòng)駕駛方案解讀
- 9 封殺AI“照騙”,“淘寶們”終于不忍了?
- 10 優(yōu)必選:營(yíng)收大增主靠小件,虧損繼續(xù)又逢關(guān)稅,能否乘機(jī)器人東風(fēng)翻身?