雙流卷積網絡:當深度學習第一次學會“看”動作|焦點關注
2026-08-24 17:35:23 |來源:科技行者
2014 年,深度學習已經在圖片識別上打得所有人心服口服。AlexNet 橫空出世兩年,卷積網絡在靜態圖像分類上把手工特征甩開了一大截,大家都覺得這套打法接下來該去視頻領域繼續摧城拔寨了。
【資料圖】
結果沒想到,視頻動作識別這塊硬骨頭,深度學習啃了整整兩年都沒啃動。
當時最好的深度學習方法,準確率停留在 65% 左右。而一個叫做“密集軌跡”的手工特征方法,能做到 87.9%。
這個差距有多大?差了將近 23 個百分點。換句話說,同樣識別 100 個動作視頻,深度學習要比手工方法多認錯 20 多個。這在圖像分類領域是不可想象的差距,那時候卷積網絡對手工特征已經是碾壓式領先了,怎么到了視頻這里,反而被倒過來碾壓?
這就是本文要講的這篇論文出現時的背景。論文的作者是 Karen Simonyan 和 Andrew Zisserman,兩人來自牛津大學的 VGG 研究組。有意思的是,幾個月后這兩人又發表了另一篇論文,叫 VGGNet,后來成了圖像分類領域的標桿網絡之一。這說明當時這個組同時在兩條戰線上作戰:一邊死磕圖片分類,一邊琢磨視頻到底該怎么喂給神經網絡吃。
問題到底難在哪
要理解這篇論文的價值,得先搞明白視頻和圖片的根本區別。
圖片是一張靜態畫面,卷積網絡只需要學會認物體的形狀、紋理、顏色組合就夠了。而視頻是一連串畫面疊加時間,動作這個東西,本質上是“變化”,不是“形狀”。你看一張揮手的靜態照片,可能根本猜不出這個人是在打招呼還是在趕蒼蠅,動作的意義藏在“時間上的變化”里,不在某一幀的畫面里。
問題就來了:卷積網絡天生擅長處理空間結構(一張圖片里像素怎么排列),但它并不天生擅長處理時間結構(一段視頻里畫面怎么變化)。之前的深度學習方法大多是把視頻簡單地看成一堆連續的圖片,硬塞給一個卷積網絡,指望網絡自己學會“運動”這個概念。
> 卷積網絡*:一種擅長處理網格狀數據(比如圖片像素)的神經網絡結構,通過滑動的“濾波器”提取局部特征,比如邊緣、紋理、形狀。
這就好比讓一個只會看照片相冊的人去判斷一段舞蹈跳得好不好。他翻著相冊里一張張剪影去猜測,肯定能看出個大概,比如這人穿了什么衣服站在什么姿勢,但很難判斷出這段舞蹈的節奏感和流暢度,因為那種感覺只存在于連續畫面之間的關系里,不存在于某一張照片本身。如果不給他看動態的東西,他永遠只能猜個大概,猜不準精細的動作類別。
之前的深度學習方法就有點像這個只能看照片相冊的人。它們試圖從一堆靜態幀里硬擠出運動信息,效果自然打了折扣。
雙流架構:把“看形狀”和“看運動”徹底分開
這篇論文最核心的想法,說出來其實不復雜:**既然一個網絡很難同時學會“認物體”和“認運動”,那就干脆用兩個網絡,一個專門負責認物體,一個專門負責認運動,最后把兩邊的判斷結果加在一起。**
這兩條“流”分別叫空間流和時間流。
> 空間流*:輸入是視頻中的單幀靜態畫面,專門負責識別畫面里有什么物體、什么場景,類似傳統的圖片分類網絡。
> 時間流*:輸入不是原始畫面,而是光流場,專門負責捕捉畫面之間的運動信息。
這里最關鍵的設計是時間流吃的“食物”不是普通的視頻幀,而是光流。
> 光流*:描述畫面中每個像素點從上一幀到下一幀移動方向和速度的一種表示方法,本質上是一張記錄了“運動方向和快慢”的圖。
為什么不直接把連續幾幀原始畫面喂給網絡,讓它自己去學運動?因為這就是之前那些方法失敗的原因,讓網絡在一堆混雜著形狀信息和運動信息的原始像素里,自己去分離出“運動”這個概念,太難了。而光流場把這件事情提前算好了,它把背景形狀、顏色這些無關的信息全部剝離掉,只留下“這個點往哪個方向動了多遠”這一個純粹的信號。相當于幫網絡提前做了一次降噪和提純。
這就像做菜前先把食材切好、去骨去皮,而不是把整只雞連毛帶內臟一起扔進鍋里讓廚師自己現場處理。如果不提前處理,廚師得先花大量精力在分辨哪些是能吃的肉、哪些是骨頭和內臟上,能不能做出好菜全看廚師自己的悟性和耐心。提前處理好之后,廚師只需要專心把火候和調味做好就行,效率和成品質量都會高很多。光流對于時間流網絡來說,就是那份已經處理好的食材。
論文里還專門做了個實驗來驗證光流的重要性。他們對比了兩種運動輸入方式,一種是光流場,一種是把原始的連續幀直接疊起來喂給網絡(論文里叫“trajectory stacking”,軌跡堆疊)。結果顯示,光流的效果明顯更好,光流版本達到 73.9%,而軌跡堆疊版本只有 67.1% 左右。差了近 7 個百分點,這說明提前把運動信息提純出來,這一步是真的有必要,不是可有可無的花活。
光流怎么塞進卷積網絡
光流這個東西本身是有方向和速度的,包含水平方向的位移和垂直方向的位移兩個分量。論文把這兩個分量當成兩張“圖”,疊在一起塞給網絡,這樣網絡的輸入就變成了一個多通道的數據結構,跟普通圖片的 RGB 三通道有點像,只是這里的“顏色”換成了“水平位移”和“垂直位移”。
單獨看一幀的光流其實信息量有限,一個瞬間的運動方向很難判斷這到底是什么動作。所以論文進一步把連續多幀的光流疊在一起,作為時間流網絡的輸入,這樣網絡能看到的不是某一瞬間的運動,而是一小段時間窗口內的運動軌跡。實驗里他們測試了不同的疊加幀數,發現疊加 10 幀左右效果最好,再往上疊加幀數增加,提升就不明顯了,說明運動信息在這個時間尺度上就已經基本表達充分了。
論文里還有一個細節挺值得說的,他們觀察了網絡第一層學到的卷積核長什么樣。結果發現這些卷積核大多呈現出明顯的方向性,像是專門用來檢測某個特定方向上的運動模式。這不是人為設計出來的,是網絡自己從光流數據里學出來的。這說明網絡確實理解了光流場里最重要的信息就是方向性,這一點和研究者的設計初衷是吻合的,算是給這套架構的合理性提供了一個直觀的證據。
兩條流怎么合并
空間流和時間流分別訓練完,各自會給出一個針對每個動作類別的概率打分。論文用的合并方式很直接,把兩條流的打分做加權平均,或者訓練一個簡單的分類器(比如支持向量機)把兩邊的打分結合起來做最終判斷。
> 支持向量機*:一種經典的機器學習分類算法,通過尋找一個最優的分界線(或分界面)把不同類別的數據點分開。
這里有個實驗結果特別能說明問題。如果只用空間流做判斷,準確率是 73%左右;如果只用時間流,準確率能到 83.7%;但兩者結合起來,能沖到 88%。這說明兩條流學到的信息確實是互補的,誰也替代不了誰。
只用空間流會怎樣?網絡看到一個人站在草地上,可能會猜這是“打高爾夫”或者“踢足球”,因為它只能靠場景和物體形狀去聯想,草地這個背景本身給出的信息有限,容易在相近場景的動作之間混淆。只用時間流又會怎樣?網絡能感覺到肢體在做出某種揮動的動作,但不知道這是在揮高爾夫球桿還是揮網球拍,因為它看不到場景和道具的樣子。兩者結合,網絡才能同時知道“這是什么場景,這個人拿著什么東西”加上“這個動作的運動軌跡長什么樣”,判斷自然就準了。
這就像是破案的時候只有指紋沒有監控錄像,或者只有監控錄像沒有指紋,破案效率都會打折扣。指紋告訴你這個人是誰(對應空間流的“認物體”),監控錄像告訴你他做了什么動作(對應時間流的“認動作”)。只有兩者對上號,案子才能辦得漂亮。如果警察非要堅持只用一種證據破案,效率一定會大打折扣,誤判率也會升高。
數據不夠怎么辦:用圖片數據集來“借力”
深度學習一個繞不開的老問題是需要大量標注數據才能訓練好,而當時的視頻動作數據集規模都不大,最大的也就幾千段視頻,跟圖片分類動輒百萬張的規模完全不能比。
> 過擬合*:模型在訓練數據上表現很好,但在沒見過的新數據上表現很差,通常是因為訓練數據太少,模型“死記硬背”了訓練集里的細節,而沒有學到真正通用的規律。
數據不夠,網絡很容易過擬合,尤其是空間流網絡。論文的解決辦法是借用圖片分類領域已經訓練好的大型網絡參數做初始化,也就是所謂的遷移學習思路,先在圖片數據集上把網絡訓練成一個“懂形狀認物體”的高手,再拿到視頻數據集上做微調。
> 遷移學習*:把一個模型在某個任務(通常是數據量很大的任務)上學到的知識,遷移到另一個數據量較小的相關任務上,避免從零開始訓練。
這就好比一個已經在別的城市開了十年出租車、對交通規則和路況判斷都很熟練的司機,搬到新城市開車,他不需要從頭學怎么開車、怎么看紅綠燈,只需要花很短時間熟悉一下新城市的路名和幾條主要道路就能上崗。如果非要讓他從零學起,把駕照考試和交規都重新學一遍,那才是真正的資源浪費??臻g流網絡借助圖片分類任務上已經學好的“認物體”能力,省下了大量重新學習基礎視覺特征的成本,只需要專注學習和動作分類相關的那部分知識。
時間流網絡因為輸入是光流場,跟普通圖片差異比較大,沒法直接借用圖片分類的預訓練參數,所以論文對時間流用了一些數據增強手段,比如裁剪、多種數據集混合訓練等方式來緩解數據不足的問題。
實驗結果:一次翻身仗
最后來看數據。論文在兩個當時主流的動作識別數據集上做了測試,一個叫 UCF-101,一個叫 HMDB-51。
| 方法 | UCF-101 準確率 | HMDB-51 準確率 |
| 手工特征(密集軌跡,此前最優) | 87.9% | 57.2% |
| 之前的深度學習方法 | 約65% | — |
| 僅空間流 | 73.0% | 40.5% |
| 僅時間流 | 83.7% | 54.6% |
| **雙流網絡(融合)** | **88.0%** | **59.4%** |
雙流網絡的結果不僅甩開了之前所有深度學習方法一大截,還第一次超過了統治了這個領域好幾年的手工特征方法。這是深度學習在視頻動作識別領域第一次真正打贏手工特征,在 2014 年,這個意義不亞于兩年前 AlexNet 在圖片分類上的突破。
這篇論文之后發生了什么
這套雙流的思路影響非常直接,后面幾年里幾乎成了視頻動作識別領域的標準范式,很多論文都是在這個骨架上做改進。
2016 年,Feichtenhofer 等人發表的論文提出了一種更巧妙的雙流融合方式,不再是簡單地在最后把兩條流的打分相加,而是在網絡中間層就讓兩條流互相交流信息,進一步把準確率往上推了一截。
2017 年,Carreira 和 Zisserman(還是這個 Zisserman)提出了 I3D 網絡,把雙流網絡里的二維卷積換成了三維卷積,直接在網絡內部同時處理空間和時間維度,并且借助一個新的更大規模的視頻數據集 Kinetics 做預訓練,把準確率進一步推高,這也成了后續很長時間里視頻理解領域的重要基準模型。
寫在后面
最讓我覺得意外的是那張卷積核可視化圖。一個網絡在完全沒有人告訴它“運動有方向性”這件事的情況下,自己從光流數據里學出了一堆方向性濾波器。這說明深度學習真正厲害的地方不是它記住了多少規則,而是它能從數據里反推出規則背后的結構。這和人類小孩學走路有點像,沒人給他講牛頓力學,他自己摸索幾百次就掌握了平衡的規律。
另外一個讓我反復琢磨的地方是,這篇論文的核心思路其實是一種“分而治之”,承認一個網絡同時學兩件差異很大的事情很難,那就拆成兩個網絡分別學。這個思路后來在很多領域都能看到影子,比如多模態模型里把文本和圖像分開編碼再融合,本質上都是同一個哲學。什么時候該拆,什么時候該合,可能是深度學習架構設計里一個值得反復問的問題。
Q&A
Q1:雙流卷積網絡是什么?
A:雙流卷積網絡是 2014 年由 Simonyan 和 Zisserman 提出的視頻動作識別方法,它用兩個獨立的卷積網絡分別處理畫面內容(空間流)和運動信息(時間流),再把兩邊的判斷結果融合,第一次讓深度學習在視頻動作識別上超過了傳統的手工特征方法。
Q2:為什么雙流網絡要用光流而不是直接用視頻幀?
A:因為光流已經把運動的方向和速度提前提取出來了,剔除了背景和形狀這些無關信息,讓時間流網絡能專注學習運動模式,而不需要自己從原始像素里費力分離出運動信息,實驗證明這樣比直接堆疊原始幀效果好很多。
Q3:雙流網絡對后續研究有什么影響?
A:這套思路成了視頻理解領域很長一段時間的標準范式,2016 年 Feichtenhofer 等人改進了兩條流之間的融合方式,2017 年 Carreira 和 Zisserman 又提出了 I3D 網絡,把二維卷積換成三維卷積并結合大規模視頻數據集,進一步推動了整個領域的發展。
標簽閱讀
-
央行:將在8月27日至9月1日開展隔夜逆回購操作 每日操作量不超過6000億元
2026-08-25 -
雙流卷積網絡:當深度學習第一次學會“看”動作|焦點關注
2026-08-24 -
北大貧困生用“母親陪嫁箱子”裝行李,網友鼻頭一酸:希望同學別欺負他|每日報道
2026-08-24 -
10塊錢引尷尬!佟麗婭當場加價解圍,這才是真正的高情商 視訊
2026-08-24 -
8月24日盈新發展漲停:旅游,體育產業,京津冀概念熱股-最資訊
2026-08-24 -
27家百億元級私募機構二季度重倉股出爐 焦點報道
2026-08-24 -
海港2-1海牛!穆斯卡特賽后毫不客氣說出原因 ,句句大實話!_焦點消息
2026-08-24 -
蘋果新品正式官宣,9月24日,活動結束
2026-08-24 -
4勝1平,切爾西此前5次英超首輪對倫敦球隊保持不敗-播資訊
2026-08-24 -
哈蘭德剃掉金發換寸頭,英超新賽季從“新發型”開始|每日熱門
2026-08-24 -
快播:生意社:8月24日常州新陽科技苯酐報價暫穩
2026-08-24 -
8月21日儲備棉成交率100% 成交均價17602.74 元/噸-快看
2026-08-24 -
最新資訊:凈投入1.36億英鎊!伊普斯維奇重返英超,這次能否避免重蹈覆轍?
2026-08-24 -
午評:A股重要利空
2026-08-24 -
再平衡進行時:小微盤迎布局良機-每日時訊
2026-08-24 -
市場監管總局發布醬香型白酒摻雜食用酒精篩查檢驗方法 每日簡訊
2026-08-24 -
男子夜幕下深陷江邊泥潭 兩名長江救援志愿隊隊員成功施救
2026-08-24 -
銀行轉賬如何設置到賬時間規則?|前沿資訊
2026-08-24 -
【獨家】負債比例怎樣估算買房決策需重視?
2026-08-24 -
施羅德:每年都有大約30名球員出入聯盟 我計劃再征戰2-4年
2026-08-24




