精品免费99久久_色www精品视频在线观看_一区二区三区日韩精品视频_亚洲国产高清自拍

第一經濟網歡迎您!
當前位置:首頁>正文內容

雙流卷積網絡:當深度學習第一次學會“看”動作|焦點關注

2014 年,深度學習已經在圖片識別上打得所有人心服口服。AlexNet 橫空出世兩年,卷積網絡在靜態圖像分類上把手工特征甩開了一大截,大家都覺得這套打法接下來該去視頻領域繼續摧城拔寨了。


【資料圖】

結果沒想到,視頻動作識別這塊硬骨頭,深度學習啃了整整兩年都沒啃動。

當時最好的深度學習方法,準確率停留在 65% 左右。而一個叫做“密集軌跡”的手工特征方法,能做到 87.9%。

這個差距有多大?差了將近 23 個百分點。換句話說,同樣識別 100 個動作視頻,深度學習要比手工方法多認錯 20 多個。這在圖像分類領域是不可想象的差距,那時候卷積網絡對手工特征已經是碾壓式領先了,怎么到了視頻這里,反而被倒過來碾壓?

這就是本文要講的這篇論文出現時的背景。論文的作者是 Karen Simonyan 和 Andrew Zisserman,兩人來自牛津大學的 VGG 研究組。有意思的是,幾個月后這兩人又發表了另一篇論文,叫 VGGNet,后來成了圖像分類領域的標桿網絡之一。這說明當時這個組同時在兩條戰線上作戰:一邊死磕圖片分類,一邊琢磨視頻到底該怎么喂給神經網絡吃。

問題到底難在哪

要理解這篇論文的價值,得先搞明白視頻和圖片的根本區別。

圖片是一張靜態畫面,卷積網絡只需要學會認物體的形狀、紋理、顏色組合就夠了。而視頻是一連串畫面疊加時間,動作這個東西,本質上是“變化”,不是“形狀”。你看一張揮手的靜態照片,可能根本猜不出這個人是在打招呼還是在趕蒼蠅,動作的意義藏在“時間上的變化”里,不在某一幀的畫面里。

問題就來了:卷積網絡天生擅長處理空間結構(一張圖片里像素怎么排列),但它并不天生擅長處理時間結構(一段視頻里畫面怎么變化)。之前的深度學習方法大多是把視頻簡單地看成一堆連續的圖片,硬塞給一個卷積網絡,指望網絡自己學會“運動”這個概念。

> 卷積網絡*:一種擅長處理網格狀數據(比如圖片像素)的神經網絡結構,通過滑動的“濾波器”提取局部特征,比如邊緣、紋理、形狀。

這就好比讓一個只會看照片相冊的人去判斷一段舞蹈跳得好不好。他翻著相冊里一張張剪影去猜測,肯定能看出個大概,比如這人穿了什么衣服站在什么姿勢,但很難判斷出這段舞蹈的節奏感和流暢度,因為那種感覺只存在于連續畫面之間的關系里,不存在于某一張照片本身。如果不給他看動態的東西,他永遠只能猜個大概,猜不準精細的動作類別。

之前的深度學習方法就有點像這個只能看照片相冊的人。它們試圖從一堆靜態幀里硬擠出運動信息,效果自然打了折扣。

雙流架構:把“看形狀”和“看運動”徹底分開

這篇論文最核心的想法,說出來其實不復雜:**既然一個網絡很難同時學會“認物體”和“認運動”,那就干脆用兩個網絡,一個專門負責認物體,一個專門負責認運動,最后把兩邊的判斷結果加在一起。**

這兩條“流”分別叫空間流和時間流。

> 空間流*:輸入是視頻中的單幀靜態畫面,專門負責識別畫面里有什么物體、什么場景,類似傳統的圖片分類網絡。

> 時間流*:輸入不是原始畫面,而是光流場,專門負責捕捉畫面之間的運動信息。

這里最關鍵的設計是時間流吃的“食物”不是普通的視頻幀,而是光流。

> 光流*:描述畫面中每個像素點從上一幀到下一幀移動方向和速度的一種表示方法,本質上是一張記錄了“運動方向和快慢”的圖。

為什么不直接把連續幾幀原始畫面喂給網絡,讓它自己去學運動?因為這就是之前那些方法失敗的原因,讓網絡在一堆混雜著形狀信息和運動信息的原始像素里,自己去分離出“運動”這個概念,太難了。而光流場把這件事情提前算好了,它把背景形狀、顏色這些無關的信息全部剝離掉,只留下“這個點往哪個方向動了多遠”這一個純粹的信號。相當于幫網絡提前做了一次降噪和提純。

這就像做菜前先把食材切好、去骨去皮,而不是把整只雞連毛帶內臟一起扔進鍋里讓廚師自己現場處理。如果不提前處理,廚師得先花大量精力在分辨哪些是能吃的肉、哪些是骨頭和內臟上,能不能做出好菜全看廚師自己的悟性和耐心。提前處理好之后,廚師只需要專心把火候和調味做好就行,效率和成品質量都會高很多。光流對于時間流網絡來說,就是那份已經處理好的食材。

論文里還專門做了個實驗來驗證光流的重要性。他們對比了兩種運動輸入方式,一種是光流場,一種是把原始的連續幀直接疊起來喂給網絡(論文里叫“trajectory stacking”,軌跡堆疊)。結果顯示,光流的效果明顯更好,光流版本達到 73.9%,而軌跡堆疊版本只有 67.1% 左右。差了近 7 個百分點,這說明提前把運動信息提純出來,這一步是真的有必要,不是可有可無的花活。

光流怎么塞進卷積網絡

光流這個東西本身是有方向和速度的,包含水平方向的位移和垂直方向的位移兩個分量。論文把這兩個分量當成兩張“圖”,疊在一起塞給網絡,這樣網絡的輸入就變成了一個多通道的數據結構,跟普通圖片的 RGB 三通道有點像,只是這里的“顏色”換成了“水平位移”和“垂直位移”。

單獨看一幀的光流其實信息量有限,一個瞬間的運動方向很難判斷這到底是什么動作。所以論文進一步把連續多幀的光流疊在一起,作為時間流網絡的輸入,這樣網絡能看到的不是某一瞬間的運動,而是一小段時間窗口內的運動軌跡。實驗里他們測試了不同的疊加幀數,發現疊加 10 幀左右效果最好,再往上疊加幀數增加,提升就不明顯了,說明運動信息在這個時間尺度上就已經基本表達充分了。

論文里還有一個細節挺值得說的,他們觀察了網絡第一層學到的卷積核長什么樣。結果發現這些卷積核大多呈現出明顯的方向性,像是專門用來檢測某個特定方向上的運動模式。這不是人為設計出來的,是網絡自己從光流數據里學出來的。這說明網絡確實理解了光流場里最重要的信息就是方向性,這一點和研究者的設計初衷是吻合的,算是給這套架構的合理性提供了一個直觀的證據。

兩條流怎么合并

空間流和時間流分別訓練完,各自會給出一個針對每個動作類別的概率打分。論文用的合并方式很直接,把兩條流的打分做加權平均,或者訓練一個簡單的分類器(比如支持向量機)把兩邊的打分結合起來做最終判斷。

> 支持向量機*:一種經典的機器學習分類算法,通過尋找一個最優的分界線(或分界面)把不同類別的數據點分開。

這里有個實驗結果特別能說明問題。如果只用空間流做判斷,準確率是 73%左右;如果只用時間流,準確率能到 83.7%;但兩者結合起來,能沖到 88%。這說明兩條流學到的信息確實是互補的,誰也替代不了誰。

只用空間流會怎樣?網絡看到一個人站在草地上,可能會猜這是“打高爾夫”或者“踢足球”,因為它只能靠場景和物體形狀去聯想,草地這個背景本身給出的信息有限,容易在相近場景的動作之間混淆。只用時間流又會怎樣?網絡能感覺到肢體在做出某種揮動的動作,但不知道這是在揮高爾夫球桿還是揮網球拍,因為它看不到場景和道具的樣子。兩者結合,網絡才能同時知道“這是什么場景,這個人拿著什么東西”加上“這個動作的運動軌跡長什么樣”,判斷自然就準了。

這就像是破案的時候只有指紋沒有監控錄像,或者只有監控錄像沒有指紋,破案效率都會打折扣。指紋告訴你這個人是誰(對應空間流的“認物體”),監控錄像告訴你他做了什么動作(對應時間流的“認動作”)。只有兩者對上號,案子才能辦得漂亮。如果警察非要堅持只用一種證據破案,效率一定會大打折扣,誤判率也會升高。

數據不夠怎么辦:用圖片數據集來“借力”

深度學習一個繞不開的老問題是需要大量標注數據才能訓練好,而當時的視頻動作數據集規模都不大,最大的也就幾千段視頻,跟圖片分類動輒百萬張的規模完全不能比。

> 過擬合*:模型在訓練數據上表現很好,但在沒見過的新數據上表現很差,通常是因為訓練數據太少,模型“死記硬背”了訓練集里的細節,而沒有學到真正通用的規律。

數據不夠,網絡很容易過擬合,尤其是空間流網絡。論文的解決辦法是借用圖片分類領域已經訓練好的大型網絡參數做初始化,也就是所謂的遷移學習思路,先在圖片數據集上把網絡訓練成一個“懂形狀認物體”的高手,再拿到視頻數據集上做微調。

> 遷移學習*:把一個模型在某個任務(通常是數據量很大的任務)上學到的知識,遷移到另一個數據量較小的相關任務上,避免從零開始訓練。

這就好比一個已經在別的城市開了十年出租車、對交通規則和路況判斷都很熟練的司機,搬到新城市開車,他不需要從頭學怎么開車、怎么看紅綠燈,只需要花很短時間熟悉一下新城市的路名和幾條主要道路就能上崗。如果非要讓他從零學起,把駕照考試和交規都重新學一遍,那才是真正的資源浪費??臻g流網絡借助圖片分類任務上已經學好的“認物體”能力,省下了大量重新學習基礎視覺特征的成本,只需要專注學習和動作分類相關的那部分知識。

時間流網絡因為輸入是光流場,跟普通圖片差異比較大,沒法直接借用圖片分類的預訓練參數,所以論文對時間流用了一些數據增強手段,比如裁剪、多種數據集混合訓練等方式來緩解數據不足的問題。

實驗結果:一次翻身仗

最后來看數據。論文在兩個當時主流的動作識別數據集上做了測試,一個叫 UCF-101,一個叫 HMDB-51。

| 方法 | UCF-101 準確率 | HMDB-51 準確率 |

| 手工特征(密集軌跡,此前最優) | 87.9% | 57.2% |

| 之前的深度學習方法 | 約65% | — |

| 僅空間流 | 73.0% | 40.5% |

| 僅時間流 | 83.7% | 54.6% |

| **雙流網絡(融合)** | **88.0%** | **59.4%** |

雙流網絡的結果不僅甩開了之前所有深度學習方法一大截,還第一次超過了統治了這個領域好幾年的手工特征方法。這是深度學習在視頻動作識別領域第一次真正打贏手工特征,在 2014 年,這個意義不亞于兩年前 AlexNet 在圖片分類上的突破。

這篇論文之后發生了什么

這套雙流的思路影響非常直接,后面幾年里幾乎成了視頻動作識別領域的標準范式,很多論文都是在這個骨架上做改進。

2016 年,Feichtenhofer 等人發表的論文提出了一種更巧妙的雙流融合方式,不再是簡單地在最后把兩條流的打分相加,而是在網絡中間層就讓兩條流互相交流信息,進一步把準確率往上推了一截。

2017 年,Carreira 和 Zisserman(還是這個 Zisserman)提出了 I3D 網絡,把雙流網絡里的二維卷積換成了三維卷積,直接在網絡內部同時處理空間和時間維度,并且借助一個新的更大規模的視頻數據集 Kinetics 做預訓練,把準確率進一步推高,這也成了后續很長時間里視頻理解領域的重要基準模型。

寫在后面

最讓我覺得意外的是那張卷積核可視化圖。一個網絡在完全沒有人告訴它“運動有方向性”這件事的情況下,自己從光流數據里學出了一堆方向性濾波器。這說明深度學習真正厲害的地方不是它記住了多少規則,而是它能從數據里反推出規則背后的結構。這和人類小孩學走路有點像,沒人給他講牛頓力學,他自己摸索幾百次就掌握了平衡的規律。

另外一個讓我反復琢磨的地方是,這篇論文的核心思路其實是一種“分而治之”,承認一個網絡同時學兩件差異很大的事情很難,那就拆成兩個網絡分別學。這個思路后來在很多領域都能看到影子,比如多模態模型里把文本和圖像分開編碼再融合,本質上都是同一個哲學。什么時候該拆,什么時候該合,可能是深度學習架構設計里一個值得反復問的問題。

Q&A

Q1:雙流卷積網絡是什么?

A:雙流卷積網絡是 2014 年由 Simonyan 和 Zisserman 提出的視頻動作識別方法,它用兩個獨立的卷積網絡分別處理畫面內容(空間流)和運動信息(時間流),再把兩邊的判斷結果融合,第一次讓深度學習在視頻動作識別上超過了傳統的手工特征方法。

Q2:為什么雙流網絡要用光流而不是直接用視頻幀?

A:因為光流已經把運動的方向和速度提前提取出來了,剔除了背景和形狀這些無關信息,讓時間流網絡能專注學習運動模式,而不需要自己從原始像素里費力分離出運動信息,實驗證明這樣比直接堆疊原始幀效果好很多。

Q3:雙流網絡對后續研究有什么影響?

A:這套思路成了視頻理解領域很長一段時間的標準范式,2016 年 Feichtenhofer 等人改進了兩條流之間的融合方式,2017 年 Carreira 和 Zisserman 又提出了 I3D 網絡,把二維卷積換成三維卷積并結合大規模視頻數據集,進一步推動了整個領域的發展。

關鍵詞: 算法 動作 雙流 深度學習 神經網絡 卷積網絡

標簽閱讀

主站蜘蛛池模板: 久久在线免费观看视频| 日本最新一区二区三区视频观看| 精品一区久久久| 视频一区三区| 国产精品日韩在线| 国产精品秘入口18禁麻豆免会员| 亚洲人成网站在线观看播放| 精品国产欧美成人夜夜嗨| 激情小说网站亚洲综合网| 欧美专区国产专区| 日韩美女视频中文字幕| 一区二区三区四区欧美日韩| 99久久自偷自偷国产精品不卡 | 一区二区三区日韩视频| 白嫩少妇丰满一区二区| 国产精品永久在线| 日韩av高清| 久久久久久久久综合| 国产精品一区二区免费看| 伊人久久大香线蕉午夜av| 国产免费色视频| 国产精品久久久久久久天堂 | 91免费视频国产| 国产v综合v亚洲欧美久久| 不卡伊人av在线播放| 久久天天躁狠狠躁夜夜av| 人妻无码视频一区二区三区 | 久久精品国产欧美激情| 欧美亚洲色图视频| 日韩人妻精品一区二区三区| 亚洲精品乱码视频| 日韩欧美一区二区视频在线播放V| 精品一区二区三区自拍图片区| 国内精品久久久久伊人av| 欧美久久综合性欧美| 久久久久国色av免费观看性色| 国产精品永久免费视频| 日韩精品无码一区二区三区| 91精品国产综合久久久久久蜜臀 | 国产成人高潮免费观看精品| 亚洲国产欧洲综合997久久|