Facebook AI發(fā)力,2D照片變3D
最先進(jìn)的機(jī)器學(xué)習(xí)算法可以從照片中提取二維物體,并在三維中忠實(shí)地呈現(xiàn)它們。這種技術(shù)可以適用于增強(qiáng)現(xiàn)實(shí)的應(yīng)用程序、機(jī)器人以及導(dǎo)航,因此它成為Facebook的一個(gè)重要研究領(lǐng)域。
在近日于首爾舉辦的國際計(jì)算機(jī)視覺會(huì)議(ICCV)之前,F(xiàn)acebook在一篇博客文章中強(qiáng)調(diào)了其在智能內(nèi)容理解方面的最新進(jìn)展。據(jù)透露,它的系統(tǒng)甚至可以用來檢測復(fù)雜的前景和背景對(duì)象,如椅子腿或重疊的家具。
“我們研究的最新進(jìn)展是建立在利用深度學(xué)習(xí)來預(yù)測和定位圖像中的物體,以及用新的工具和架構(gòu)來理解三維形狀,如體素、點(diǎn)云和網(wǎng)格,”Facebook的研究人員Georgia Gkioxari、Shubham Tulsiani和David Novotny在一篇博客中寫道!叭S理解將在提高人工智能系統(tǒng),更貼近地理解、解釋和操作現(xiàn)實(shí)世界的能力方面發(fā)揮核心作用!
其中一個(gè)亮點(diǎn)是Mesh R-CNN,這是一種能夠從雜亂和遮擋物體的圖像中預(yù)測三維形狀的方法。
Facebook的研究人員表示,他們在開源的Mask R-CNN的二維目標(biāo)分割系統(tǒng)上增加了一個(gè)網(wǎng)格預(yù)測分支,并使用一個(gè)包含高度優(yōu)化的三維操作符的庫(Torch3d),來進(jìn)一步支持該系統(tǒng)。Mesh R-CNN有效地利用了Mask R-CNN對(duì)圖像中不同的物體進(jìn)行檢測和分類,然后利用上述的預(yù)測器對(duì)三維形狀進(jìn)行推斷。
Facebook表示,在公共可用的Pix3D語料庫上進(jìn)行評(píng)估后,Mesh R-CNN成功地檢測到所有類別的物體,并在家具場景中估計(jì)它們的完整三維形狀。在一個(gè)單獨(dú)的數(shù)據(jù)集上(ShapeNet ),Mesh R-CNN比之前的研究有7%的相對(duì)優(yōu)勢。
Facebook開發(fā)的另一個(gè)系統(tǒng)是Canonical 3D Pose Networks,簡稱為C3DPO,解決了網(wǎng)格和相應(yīng)圖像無法用于訓(xùn)練的情況。建立三維關(guān)鍵點(diǎn)模型重建,利用二維關(guān)鍵點(diǎn)監(jiān)控實(shí)現(xiàn)最先進(jìn)的重建結(jié)果。(這里的關(guān)鍵點(diǎn)指的是被跟蹤的物體部分,它們提供了一組關(guān)于幾何圖形及其視角變化的線索。)
C3DPO利用重建模型預(yù)測相應(yīng)攝像機(jī)視點(diǎn)參數(shù)和三維關(guān)鍵點(diǎn)位置。輔助組件與模型一起學(xué)習(xí),以解決在分解三維視點(diǎn)和形狀時(shí)引入的模糊性。
Facebook指出,這種重建在以前是可以實(shí)現(xiàn)的,部分原因是內(nèi)存限制。C3DPO體系結(jié)構(gòu)可以在硬件無法捕獲的情況下進(jìn)行三維重建,比如對(duì)大型的對(duì)象。
“(三維)計(jì)算機(jī)視覺有許多開放的研究問題,我們正在試驗(yàn)多種問題陳述、技術(shù)和監(jiān)督方法,以探索推動(dòng)該領(lǐng)域向前發(fā)展的最佳方式,就像我們在二維理解領(lǐng)域所做的那樣,”Gkioxari、Tulsiani和Novotny表示!半S著數(shù)字世界適應(yīng)并轉(zhuǎn)向使用3D照片、沉浸式AR和VR體驗(yàn)等產(chǎn)品,我們需要不斷推動(dòng)復(fù)雜的系統(tǒng)更準(zhǔn)確地理解視覺場景中的對(duì)象并與之互動(dòng)!

發(fā)表評(píng)論
請輸入評(píng)論內(nèi)容...
請輸入評(píng)論/評(píng)論長度6~500個(gè)字
最新活動(dòng)更多
-
即日-9.16點(diǎn)擊進(jìn)入 >> 【限時(shí)福利】TE 2025國際物聯(lián)網(wǎng)展·深圳站
-
10月23日火熱報(bào)名中>> 2025是德科技創(chuàng)新技術(shù)峰會(huì)
-
10月23日立即報(bào)名>> Works With 開發(fā)者大會(huì)深圳站
-
10月24日立即參評(píng)>> 【評(píng)選】維科杯·OFweek 2025(第十屆)物聯(lián)網(wǎng)行業(yè)年度評(píng)選
-
11月27日立即報(bào)名>> 【工程師系列】汽車電子技術(shù)在線大會(huì)
-
12月18日立即報(bào)名>> 【線下會(huì)議】OFweek 2025(第十屆)物聯(lián)網(wǎng)產(chǎn)業(yè)大會(huì)
推薦專題
- 1 先進(jìn)算力新選擇 | 2025華為算力場景發(fā)布會(huì)暨北京xPN伙伴大會(huì)成功舉辦
- 2 人形機(jī)器人,正狂奔在批量交付的曠野
- 3 宇樹機(jī)器人撞人事件的深度剖析:六維力傳感器如何成為人機(jī)安全的關(guān)鍵屏障
- 4 解碼特斯拉新AI芯片戰(zhàn)略 :從Dojo到AI5和AI6推理引擎
- 5 AI版“四萬億刺激”計(jì)劃來了
- 6 2025年8月人工智能投融資觀察
- 7 8 a16z最新AI百強(qiáng)榜:硅谷頂級(jí)VC帶你讀懂全球生成式AI賽道最新趨勢
- 9 Manus跑路,大廠掉線,只能靠DeepSeek了
- 10 地平線的野心:1000萬套HSD上車