英特爾研究院6月21日宣布與Blockade Labs合作發(fā)布LDM3D(Latent Diffusion Model for 3D)模型,這一全新的擴(kuò)散模型使用生成式AI創(chuàng)建3D視覺內(nèi)容。

據(jù)介紹,LDM3D是業(yè)界領(lǐng)先的利用擴(kuò)散過程(diffusion process)生成深度圖(depth map)的模型,進(jìn)而生成逼真的、沉浸式的360度全景圖。LDM3D有望革新內(nèi)容創(chuàng)作、元宇宙應(yīng)用和數(shù)字體驗(yàn),改變包括娛樂、游戲、建筑和設(shè)計(jì)在內(nèi)的許多行業(yè)。
英特爾表示,LDM3D是在LAION-400M數(shù)據(jù)集包含一萬個(gè)樣本的子集上訓(xùn)練而成的。LAION-400M是一個(gè)大型圖文數(shù)據(jù)集,包含超過4億個(gè)圖文對(duì)。對(duì)訓(xùn)練語料庫(kù)進(jìn)行標(biāo)注時(shí),研究團(tuán)隊(duì)使用了之前由英特爾研究院開發(fā)的稠密深度估計(jì)模型DPT-Large,為圖像中的每個(gè)像素提供了高度準(zhǔn)確的相對(duì)深度。LAION-400M數(shù)據(jù)集是基于研究用途創(chuàng)建而成的,以便廣大研究人員和其它興趣社群能在更大規(guī)模上測(cè)試模型訓(xùn)練。
LDM3D模型在一臺(tái)英特爾AI超級(jí)計(jì)算機(jī)上完成了訓(xùn)練,該超級(jí)計(jì)算機(jī)由英特爾至強(qiáng)處理器和英特爾Habana Gaudi AI加速器驅(qū)動(dòng)。最終的模型和流程整合了RGB圖像和深度圖,生成360度全景圖,實(shí)現(xiàn)了沉浸式體驗(yàn)。