您现在的位置是:热点 >>正文

清华联手哈佛团队推出全新AI系统:能更准确描述3D场景

热点1人已围观

简介近日,清华大学携手哈佛大学共同开发了名为LangSplat的全新AI系统,能够在三维空间内高效、准确地搜索开放式词汇。LangSplat是第一个基于3DGS的3D语言场方法,特别引入了SAM和CLIP ...

  近日,清华全新清华大学携手哈佛大学共同开发了名为LangSplat的联手全新AI系统,能够在三维空间内高效、哈佛准确地搜索开放式词汇。团队推出

游侠网1

  LangSplat是第一个基于3DGS的3D语言场方法,特别引入了SAM和CLIP,准确在开放词汇3D对象定位和语义分割任务上优于最先进的描述方法,同时比LERF快199倍。清华全新

  加州大学伯克利分校的联手研究人员于2023年3月展示了语言嵌入式辐射场(LERF),将语言嵌入从现成模型(如CLIP)嵌入到NeRF中,哈佛从而在不需要专门培训的团队推出情况下,在三维环境中准确识别物体。系统

  例如在书店的准确NeRF环境中,用户可以用自然语言搜索特定的描述书名。这项技术还可用于机器人技术、清华全新模拟机器人的视觉训练以及人类与三维世界的互动。

游侠网2

  不过LERF的短板在于不适合实时搜索,且搜索结果准确率低。

  LangSplat为了解决这个短板,使用3D Gaussians构建3D语言场,避免了NeRFs所需的复杂渲染过程,在1440x1080像素的分辨率下,LangSplat比LERF快199倍。

  团队展示了泡有茶叶的茶杯,LERF标记的是两个杯子,而LangSplat标记的是杯子中的液体。在另一个例子中,它可以标记一碗拉面汤中的单个配料。

游侠网3

  LangSplat为了形成3D语言场,使用Meta的“分段任意模型”(Segment Anything Model)从场景的多幅图像中学习分层语义。

  具体来说,图像会被分解成边界清晰的不同物体掩码,而物体又会被进一步分解成整体、部分和子部分。

游侠网4

  然后,CLIP对学习到的遮罩进行处理,其嵌入会训练一个自动编码器,然后用于训练LangSplat的3D Gaussian Splatting。

游侠网5

  研究人员使用LERF和3D OVS两个数据集对LangSplat进行测试,结果显示总体准确率分别达到了84.3%和93.4%,而LERF分别为73.6%和86.8%。

Tags:

相关文章

  • 河南省统计局开展上半年房地产企业问卷调查

    热点

    【建材网】为准确把握和判断上半年全省房地产市场运行情况及全年走势,进一步了解房地产开发企业投资、销售、土地储备、资金、新开工楼盘等情况,5月21日省统计局下发了《关于开展上半年房地产开发企业经营情况问 ...

    热点

    阅读更多
  • 我市工业投资增速跃居全省第一

    热点

    雅安日报/北纬网讯19日,记者从市经济和信息化局获悉,1至11月,我市工业投资实现高速增长,增速达32.6%,较1至10月攀升5.8个百分点,比全省工业投资增速高25.9个百分点,跃居全省第1位。得益 ...

    热点

    阅读更多
  • 荥经一市民为职业学校师生帮忙修车点赞

    热点

    雅安日报/北纬网讯12月18日,荥经县市民岑夏光打进本报新闻热线,告知荥经职业学校汽修专业班师生把送给他们练习修理技术的“患病”小车,修好了,还将修好的小车送还给他,既不要工钱也不吃便饭,这样的好人好 ...

    热点

    阅读更多


友情链接