分析解读 / 声音驱动场景 · 研究案例

EchoForge 用空间音频在 Unity 中生成可探索的 3D 场景

EchoForge 把声音事件识别、方向线索、显式场景图和程序化规则接在一起,将空间录音转成可探索的 Unity 环境。它生成的是对声景的合理解释,不是对真实几何的精确复刻。

发布 事件
Unity 中明亮的程序化森林包含池塘和树木,画面还标出检测到的鸟鸣声音源。
EchoForge 生成的声音驱动场景
值得谁关注

适合探索用空间音频辅助程序化世界构建、XR 可视化或无障碍界面的技术美术、声音设计师与关卡设计师。

2026 年 9 月 11 日,80 Level 发布了 EchoForge 两位研究者对项目流程的完整说明。这个研究原型尝试从空间录音出发,在没有文字提示词的情况下生成一套可探索的 Unity 环境。

EchoForge 的论文发表于 7 月的 SIGGRAPH 2026,作者是 ESGI 的 Anamaria Buliga 与 Kamil Tebani,并获得了 SIGGRAPH 学生研究竞赛本科组第一名。因此,这次值得关注的是新公开的详细方法与限制,不是一个刚上线的商业产品。

四路空间音频波形先转成场景图数据,再在 Unity 中生成位于右侧声音源区域的鸟群。
声音、场景图与右侧鸟群

先听见声音,再决定场景里有什么

系统先分析录音中声音出现的时段和大致方向,同时用 YAMNet 识别鸟鸣、鸭叫、昆虫、风、树叶摩擦和水声等声音事件。它不会把每个分类标签直接变成一个物体,而是把相近结果归入森林、水体、风、鸟类或水禽等更高层语义。

方向证据和语义结果随后合并。某种声音如果多次从稳定方向出现,系统可以把它记为一个局部声音源区域;风声这类分散而难以定位的内容,则更适合作为环境信息保留。弱证据不会被强行解释成一个具体物体。

场景图把模型判断和生成规则分开

EchoForge 的中间层是一张显式声音场景图,其中记录推断出的环境、候选声音源、置信度、空间线索、时间变化和一致性检查。最终画面里的对象因此可以追溯到录音证据或一条明确的程序化规则,而不是只留下一个无法检查的生成结果。

场景图再转换成 Unity 可以读取的布局指令,用于安排地形、植被簇、水域、声音源区域、环境氛围和代表性物体。公开的农场样例中,鸟鸣、农场鸟类和鸭叫标签与稳定的右侧方向共同触发了右侧鸟群区域。

EchoForge 流程将空间音频依次送入探测、语义标记和语义空间融合,再生成声音场景图、程序化布局与 Unity 演示。
从空间音频到 Unity 场景的处理流程

它生成的是合理解释,不是实景复刻

仅靠声音无法知道一棵树的准确形状、池塘的尺寸或鸟与录音设备之间的精确距离。EchoForge 用声学信息估计大致方向,物体尺度与视觉表现仍由程序化规则决定。相同录音可能支持不止一种合理场景,因此结果不应被理解为对录音地点的测量级重建。

研究者也公开了当前词表的边界。系统能识别蟋蟀或黄昏场景中的昆虫声音,但如果生成阶段没有与该标签对应的资产和规则,场景图只能把它标成未解析,无法放置具体对象。识别到声音和知道怎样把它画进世界,是两个不同的问题。

目前公开材料展示的是三个定性样例:农场鸟声得到明确布局,有风森林得到可用但不唯一的解释,蟋蟀样例暴露了规则缺口。它们能说明流程怎样工作,还不足以证明生成速度、适用环境范围或生产项目中的稳定性。

对游戏团队更像一个原型入口

这条路径适合把环境录音变成前期世界构建的起点。声音设计师可以先提供一段有清楚方向变化的氛围录音,技术美术和关卡设计师再检查场景图如何解释声音、哪些判断不稳定,以及程序化规则怎样把这些判断变成可行走的粗略布局。

它也可以帮助 XR 团队查看空间声音被系统定位到哪里,或把声音类型、方向和局部/环境属性转成视觉提示,为听障用户提供另一种感知声景的方式。真正用于游戏制作时,仍需要设计师决定地形、路径、比例、玩法和最终资产;EchoForge 提供的是一套可检查的场景假设,而不是完成后的关卡。

参考来源 (3)
  1. 80 Level · EchoForge Uses Spatial Sound to Build 3D Worlds in Unity
  2. ACM · EchoForge: Interpretable Audio-Conditioned Procedural Scene Generation from Spatial Sound
  3. SIGGRAPH 2026 · Student Research Competition results

本文无赞助或联盟链接。