无需3D数据也能训练,港科&港中文联手华为推出3D自动驾驶场景生成模型

1,432次阅读
没有评论

允中 发自 凹非寺
量子位 | 公众号 QbitAI

无需采集3D数据,也能训练出高质量的3D自动驾驶场景生成模型。

这是来自香港中文大学、香港科技大学和华为诺亚方舟实验室的最新研究成果——针对自动驾驶街景的可控3D场景生成方法“MagicDrive3D”。

此前,采用常见的2D自动驾驶数据集来生成3D街景的方法不是没有,但受采集角度所限,生成结果的可控性和几何一致性无法同时满足。而现在,MagicDrive3D通过结合可控生成与场景重建解决了这一限制。

不仅支持多条件控制,还突破了原始数据的局限,即使在原始图像不一致的情况下,也能建立出连贯的高质量模型。

无需3D数据也能训练,港科&港中文联手华为推出3D自动驾驶场景生成模型

即使场景中有很多物体,生成结果依然真实可靠:

而且支持天气情况的文本控制,可以一键从晴天切换到雨天:

道路结构、物体位置都能够精确控制(随机保留50%车):

还可以一键实现白天与夜晚的转换(随机保留25%车):

总之,这项成果解决了自动驾驶等无边界场景下3D场景的高质量模型开发难题,可以有效帮助BEV分割等下游感知任务。

常规驾驶数据即可实现可控场景生成

3D自动驾驶场景生成应用广阔,然而目前3D资产的生成方法通常局限于以物体为中心的生成场景,对于自动驾驶中无界限的大场景生成缺乏探索。

但从应用的角度来说,可控的生成方法在下游应用中价值更高,针对这个痛点,MagicDrive3D提出了一种新颖的框架,在常规的自动驾驶数据集上即可训练出3D场景生成模型,而且支持多种条件控制!

MagicDrive3D继承了前一代MagicDrive诸多优点,其多条件控制可以实现场景、背景和前景的多层次街景图像编辑,用来生成更多的自动驾驶3D场景。

无需3D数据也能训练,港科&港中文联手华为推出3D自动驾驶场景生成模型

MagicDrive3D 的多视角渲染能力

而且生成的场景支持多相机视角的渲染,例如全景图渲染:

无需3D数据也能训练,港科&港中文联手华为推出3D自动驾驶场景生成模型

在目前应用最广泛的nuScenes数据集上,MagicDrive3D在视频生成和场景生成两方面相比于baseline,均表现出明显优势。

无需3D数据也能训练,港科&港中文联手华为推出3D自动驾驶场景生成模型

MagicDrive3D的生成效果评估

此外,MagicDrive3D生成的图片还可以直接用于数据增强,可以在BEV分割任务中提升相机参数的鲁棒性。

无需3D数据也能训练,港科&港中文联手华为推出3D自动驾驶场景生成模型

MagicDrive3D的生成数据在下游任务的效果

那么,MagicDrive3D究竟是如何做到的呢?

先合成,再重建

随着扩散模型的发展,图片、视频生成的方法层出不穷,但是受限制于现有的数据采集形式,这些方法只能生成固定的相机视角,对场景几何缺乏建模(geometry-free),因而无法拓展到更多视角。

能够支持多视角的重建方法,虽然能够提供几何一致性的保证(geometry-focused),却又受到了真实采集的数据(静态、多视角数据)的限制,常见的自动驾驶数据集根本无法满足这些要求。

为了填补这部分空白,MagicDrive3D提出了一个将视角合成方法与场景重建方法相结合的框架。

该框架充分利用前者的可控性以及后者的几何一致性,实现了接受多种控制条件的3D街景场景合成。

无需3D数据也能训练,港科&港中文联手华为推出3D自动驾驶场景生成模型

MagicDrive3D的方法框架

具体来说,MagicDrive3D首先训练了一个细粒度可控的视频生成模型,不仅能够通过语义信息控制,视频中每个视角的相机参数都经过统一坐标系编码,使得生成的多视角视频具备更强的几何一致性。

接着,为了提供更强的几何一致性保证以及多视角渲染,MagicDrive3D提出可形变的高斯泼溅作为场景的3D表征,结合单目深度点云进行重建。

最终得到的驾驶场景能够合理的反应各种控制条件,并且支持任意相机视角的精确渲染。

总的来说,MagicDrive3D带来了一个全新的、高效的可控3D场景生成框架,不仅成功解决了无界限的3D场景生成难题,其可控性更为多种下游任务提供了支持。

相比前序工作MagicDrive,MagicDrive3D不仅提供了多视角渲染能力,生成的场景几何信息也为更多样的场景编辑提供可能。

随着质量和真实性的提升,生成数据将得到更广泛的应用,为自动驾驶技术的发展注入更多活力。

论文地址:
https://arxiv.org/abs/2405.14475
项目主页:
https://gaoruiyuan.com/magicdrive3d/

Read More 

正文完
可以使用微信扫码关注公众号(ID:xzluomor)
post-qrcode
 0
评论(没有评论)

文心AIGC

2024 年 6 月
 12
3456789
10111213141516
17181920212223
24252627282930
文心AIGC
文心AIGC
人工智能ChatGPT,AIGC指利用人工智能技术来生成内容,其中包括文字、语音、代码、图像、视频、机器人动作等等。被认为是继PGC、UGC之后的新型内容创作方式。AIGC作为元宇宙的新方向,近几年迭代速度呈现指数级爆发,谷歌、Meta、百度等平台型巨头持续布局
文章搜索
热门文章
潞晨尤洋:日常办公没必要上私有模型,这三类企业才需要 | MEET2026

潞晨尤洋:日常办公没必要上私有模型,这三类企业才需要 | MEET2026

潞晨尤洋:日常办公没必要上私有模型,这三类企业才需要 | MEET2026 Jay 2025-12-22 09...
反超Nano Banana!OpenAI旗舰图像生成模型上线

反超Nano Banana!OpenAI旗舰图像生成模型上线

反超Nano Banana!OpenAI旗舰图像生成模型上线 Jay 2025-12-17 10:25:43 ...
“昆山杯”第二十七届清华大学创业大赛决赛举行

“昆山杯”第二十七届清华大学创业大赛决赛举行

“昆山杯”第二十七届清华大学创业大赛决赛举行 一水 2025-12-22 17:04:24 来源:量子位 本届...
企业级智能体落地,谁没踩这四种大坑?无问芯穹的系统性解法来了

企业级智能体落地,谁没踩这四种大坑?无问芯穹的系统性解法来了

企业级智能体落地,谁没踩这四种大坑?无问芯穹的系统性解法来了 衡宇 2025-12-16 20:10:53 来...
最新评论
ufabet ufabet มีเกมให้เลือกเล่นมากมาย: เกมเดิมพันหลากหลาย ครบทุกค่ายดัง
tornado crypto mixer tornado crypto mixer Discover the power of privacy with TornadoCash! Learn how this decentralized mixer ensures your transactions remain confidential.
ดูบอลสด ดูบอลสด Very well presented. Every quote was awesome and thanks for sharing the content. Keep sharing and keep motivating others.
ดูบอลสด ดูบอลสด Pretty! This has been a really wonderful post. Many thanks for providing these details.
ดูบอลสด ดูบอลสด Pretty! This has been a really wonderful post. Many thanks for providing these details.
ดูบอลสด ดูบอลสด Hi there to all, for the reason that I am genuinely keen of reading this website’s post to be updated on a regular basis. It carries pleasant stuff.
Obrazy Sztuka Nowoczesna Obrazy Sztuka Nowoczesna Thank you for this wonderful contribution to the topic. Your ability to explain complex ideas simply is admirable.
ufabet ufabet Hi there to all, for the reason that I am genuinely keen of reading this website’s post to be updated on a regular basis. It carries pleasant stuff.
ufabet ufabet You’re so awesome! I don’t believe I have read a single thing like that before. So great to find someone with some original thoughts on this topic. Really.. thank you for starting this up. This website is something that is needed on the internet, someone with a little originality!
ufabet ufabet Very well presented. Every quote was awesome and thanks for sharing the content. Keep sharing and keep motivating others.
热评文章
小米语音首席科学家:AI发展的本质就像生物进化,不开源要慢1000倍 | MEET2026

小米语音首席科学家:AI发展的本质就像生物进化,不开源要慢1000倍 | MEET2026

小米语音首席科学家:AI发展的本质就像生物进化,不开源要慢1000倍 | MEET2026 克雷西 2025-...
顶尖技术+标准产品+创新模式+可靠服务,打造大模型商业落地中国范式

顶尖技术+标准产品+创新模式+可靠服务,打造大模型商业落地中国范式

顶尖技术+标准产品+创新模式+可靠服务,打造大模型商业落地中国范式 思邈 2025-12-16 10:24:0...
PPIO姚欣:AI正在进入自主行动与创造时代,智能体需要全新的操作系统|MEET2026

PPIO姚欣:AI正在进入自主行动与创造时代,智能体需要全新的操作系统|MEET2026

PPIO姚欣:AI正在进入自主行动与创造时代,智能体需要全新的操作系统|MEET2026 梦瑶 2025-12...
Dexmal原力灵机提出ManiAgent,用多智能体协作重构机器人操控

Dexmal原力灵机提出ManiAgent,用多智能体协作重构机器人操控

Dexmal原力灵机提出ManiAgent,用多智能体协作重构机器人操控 量子位的朋友们 2025-12-16...
推特吵架吵出篇论文!谢赛宁团队新作iREPA只要3行代码

推特吵架吵出篇论文!谢赛宁团队新作iREPA只要3行代码

推特吵架吵出篇论文!谢赛宁团队新作iREPA只要3行代码 henry 2025-12-16 15:03:31 ...