Inworld AI

把语音、语言模型与游戏动作连起来,先做一个有边界的实时 NPC。

证据状态基于公开资料评估中等置信度最后核验 2026年9月1日编辑:MakeGameWithAI

应用介绍

Inworld AI 是什么,以及它如何使用。

Inworld AI 是面向实时互动 Agent 的运行时技术栈。它可以接收玩家麦克风声音,转成文字,把对话与角色上下文交给选定语言模型,再把生成回答以流式语音返回;记忆、知识、回合判断、附和反馈和工具调用也可以放在同一条可观察管线中。

Unity 与 Unreal 模板提供了较短的对话角色起步路径。你定义职责、声音、动机与限制,连接 Runtime,再从文字或按键说话示例开始。角色模型、动画、导航、任务事实、动作权限、奖励和存档仍由游戏负责;Inworld 不是一个自动生成完整 NPC 或完整游戏系统的按钮。

因此,即使不会自行搭建整套 STT—LLM—TTS 系统,也可以从第一个语音 NPC 开始。先在小场景做一个讲解员、证人、陪伴角色或可选提示角色。对话要触发动作、服务更多玩家时,代码与引擎判断会越来越重要,但它们不是探索第一个受限互动的入场资格。

使用方式

搜索索引中的 Unity 路径最低为 Unity 2022.3 LTS,推荐 6000.0.41 或更新;Unreal 路径列出 5.4–5.7 与 C++ 项目。两者都从 API key 和示例角色开始。核验时当前引擎文档会跳转登录,因此改动生产项目之前应在账号内确认包版本与发布说明。

让玩家说,让角色回答

在同一会话中把麦克风音频依次送入语音识别、选定 LLM 与 TTS。回合判断和流式传输减少基础拼装,但游戏中的真实延迟仍受模型、网络、上下文和客户端影响。

O05O06

定义记忆、上下文与声音

角色上下文、知识、对话历史、长期记忆与声音指令都能影响回答;更长上下文也可能增加 token 用量,生成陈述不能直接作为权威游戏事实。

O05O06O08

把工具调用接到游戏逻辑

Runtime 可以在不中断语音会话的情况下请求已注册工具。每次请求都应视为提议,由游戏校验动作、参数、权限和最终状态变化。

O02O05O06U04

从 Unity 或 Unreal 示例开始

搜索索引中的 Quickstart 包括 Unity 文字/按键语音示例,以及 Unreal Character/Chat 模板。正式发布仍需处理版本兼容、凭据后端、日志、重连和目标设备检查。

O03O04O15O16
本页评估范围

首个受限语音 NPC、小型 Unity/Unreal 原型,以及透明的公开单价预算。本页不证明当前中文质量、端到端延迟、长时稳定性、生产并发、实测账单或合格会话成功率。

入门友好度需要一定基础
示例能减少语音管线搭建,但做首个引擎 NPC 仍需学习插件、场景配置和密钥;网页试听比这更简单。
Agent 接入便利度接入方便
官方 Realtime API 有认证和流式会话示例,可接入 Agent 编排的语音流程;不是一键生成完整 NPC。
查看适用范围、接入条件与来源核验

入门范围:以引擎示例或 WebSocket 模板搭建一个受限语音 NPC。

Agent 范围:建立语音/文本会话并接收输出事件。

判断置信度:入门 中 · Agent 中

准入与认证
配置 Runtime API key,推荐由后端代理保护,不把长期密钥写入玩家客户端。
费用边界
按语音、模型及会话用量核对账户和容量;不能用一次离线音频价格代替持续会话成本。
取得结果
建立 WebSocket,会话内发送输入、接收文字或音频事件并关闭连接。
关键限制
角色动作和游戏规则仍由项目实现;引擎 SDK、Realtime 与各子服务的状态不能混为一谈。

两项为独立的编辑判断,不是综合评分,也不代表本站已完成 Agent 接入测试。

关键发现

证据支持什么,不支持什么。

01
官方事实高置信度

一套 Runtime 减少拼装,不替代游戏设计

Inworld 把语音识别、选定 LLM、流式声音、记忆与工具放进一条可观察路径,引擎模板能让角色更快开口;角色资产、导航、任务、权限校验、状态变化和失败体验仍是游戏自己的工作。

O02O03O04O05O15
02
用户报告中等置信度

开放对话可以更沉浸,也可能完不成任务

历史开发者、玩家、记者与一项 48 人研究在受限场景中发现了新鲜感、情绪投入或表达自由;同一批证据也包含识别错误、跑题或错误回答、打断与连接中断。总体体验正面不等于任务执行可靠。

U01U05U06U08U09U10
03
编辑判断低置信度

当前 Agent Runtime 仍缺少足够独立游戏证据

多数详细游戏记录来自 2023–2024 Character Engine。近期材料主要是一条未给出最终测量结果的 Runtime 排障帖,以及两条非游戏 TTS 使用线索。这足以支持做小样,不足以给出当前成功率、中文质量或生产成熟度标签。

O02O14U10U11U12U13
04
编辑判断中等置信度

生成意图应请求动作,而不是成为裁决者

Cygnus 团队为具体游戏行为增加了自建意图层,媒体和研究案例仍遇到误解或编造。应只注册范围清楚的工具、校验参数,并让重要状态变化保持确定性。

O05O06U04U08U10
05
官方事实高置信度

费用要把输入语音、输出语音和模型 token 一起算

STT 按玩家音频时间计费,TTS 按生成字符计费,选定 LLM 再按输入/输出 token 计费;套餐还会改变单价和请求容量。较低的名义单次费用不包含订阅现金、重试、后端、上下文增长或玩家实际接受的会话比例。

O07O08

编辑结论

我们的判断

中等置信度

如果语音交谈本身就是游戏体验的一部分,而你不想从零拼接语音识别、语言模型和语音输出,Inworld 值得作为候选。它也给新手提供了真实起点:先在小场景做一个只负责一件事的角色。奖励、背包、战斗、任务完成和存档应留在确定性的游戏逻辑中。当前 Agent Runtime 比多数独立游戏证据更新,因此在把它变成核心生产依赖之前,应先完成小型原型。

结论范围经 Owner 审核通过的中等置信度公开资料评估。14 条独立记录覆盖 10 个平台,支持有范围的工作流与失败类型判断;当前 Runtime 实际表现仍为低置信度,本站没有进行产品实测。

更适合

这些情况下值得试

  • 希望先做一个语音角色、又不想自行搭建整套语音与模型管线的创作者,包括新手。
  • 职责清楚的讲解员、证人、陪伴角色、可选任务提示与 VR 互动。
  • 允许对话灵活生成,同时由游戏代码校验动作、事实、奖励和存档的项目。
  • 能在扩大开放前测量语音用量、模型 token、峰值会话和后端要求的小范围项目。

不太适合

这些情况下先别依赖它

  • 要求角色完全离线运行,或不能接受持续服务与后端依赖的项目。
  • 关键对白和剧情分支必须每次完全一致,却没有预写兜底的项目。
  • 准备让生成回答直接发放物品、修改存档、执行购买或决定战斗结果的项目。
  • 把厂商延迟主张、旧 demo 或名义单次费用当成当前生产成熟度证明的项目。

工作流定位

放在制作流程的什么位置。

01

先定义一个有边界的角色职责

选择讲解员、证人、陪伴角色或提示角色,写清它知道什么、不能声称什么,以及最多可以请求哪个低风险工具。在接入更大场景前,先准备职责内、职责外和打断类问题。

护栏使用虚构、非敏感材料;不要让生成对白直接改变奖励、购买或存档进度。
02

接通最小引擎示例

在可丢弃项目副本中使用当前 Unity 文字/按键语音示例或 Unreal Chat 模板。先加入字幕、一个无副作用动作和逐阶段日志,再增加自定义动画、记忆或多个角色。

护栏把 Base64 凭据留在后端,只向客户端签发短期 token;在当前文档账号内确认包版本。
03

先测有限试玩,再估算开放规模

邀请少量玩家,记录识别结果、首段音频时间、完整回答时间、打断、工具验收、断线和 credits,再据此估算合格会话成本与峰值容量。

护栏对话缓慢或不可用时提供预写兜底和退出路径;这些是建议检查,不是本站已完成的产品测试。

推荐工作流

把这项工具放进完整制作流程。

从可验证的 Brief 开始,逐步完成原型、资产、音频、测试与发布,并明确每一步的交接物和人工检查。

打开完整方法

最短验证路径

先做一个 NPC、一个安全动作和二十条测试输入

以下是根据本轮证据整理出的低风险起步方法。

  1. 01

    选择一个职责清楚的角色,写一份简短事实表:身份、已知事实、禁止声称的内容、语气,以及唯一允许请求的工具。

  2. 02

    准备二十条输入,覆盖普通对话、职责边界、重复提问、打断、沉默、中文或口音需求,以及未授权动作请求。

  3. 03

    在可丢弃项目副本中接通当前 Unity 或 Unreal 示例。凭据放在后端,加入字幕,只暴露一个没有不可逆副作用的动作。

  4. 04

    在目标网络和设备运行这些输入,记录转写、首段音频、完整回答、规则遵从、工具校验、重连行为和真实 credits。

  5. 05

    再让少量玩家体验同一受限场景。定义合格会话并算清真实成本、峰值会话、隐私告知与预写兜底后,才扩大开放。

价格与权利

你在为什么付费,一段对话会消耗多少

价格与条款最后核验:2026年9月1日

  • 自助月付套餐为 On-Demand $0、Creator $25、Builder $100、Developer $300、Growth $1,500。付费套餐包含与月费等额的 credits;Enterprise 为定制。
  • 上述档位的 TTS-2 每 100 万字符依次为 $25 / $20 / $17.50 / $15 / $12.50;TTS-2 Flash 为 $15 / $10 / $9 / $8 / $7。页面按厂商预算假设,约 1,000 字符对应一分钟音频。
  • On-Demand 的 STT 为每小时音频 $0.15,付费自助档为 $0.10。完整语音 NPC 还会消耗所选 LLM 的输入和输出 token。
  • 请求限制依次为 5 / 10 / 50 / 150 / 500,厂商估算会话并发为 20 / 40 / 200 / 600 / 2,000。这些是容量标签,不是月度产出或延迟 SLA。
  • On-Demand 宣传最多 70 分钟 TTS 或 400 分钟 STT 免费。公开文字没有充分说明重置周期、能否同时使用和完整管线的扣减方式,因此下方长期预算不减这部分免费量。
  • 订阅 credits 在维持同档或更高档时最多结转三个月;额外购买 credits 十二个月后过期,降档或取消生效时会失去剩余额度。
  • 模型目录与定价页使用了不同的模型数量口径。本页只采用一个明确列出的模型和精确单价,不宣称固定模型数量。
成本与产出

一个明确的 10 分钟语音 NPC 情景

这是公开单价算式,不是实测账单:一段 10 分钟会话包含玩家说 5 分钟、NPC 说 5 分钟(5,000 字符)、10 个回合、12,000 输入 token 与 1,500 输出 token;LLM 使用 Gemini 2.5 Flash,每 100 万输入/输出 token 为 $0.30 / $2.50。不减免费量,也不含重试、记忆/RAG 增长、审核、工具、后端、税和人工。

O07O08
实际 Creator 订阅$25 / 月

实付 $25,获得 $25 月度 credits,并按 Creator 单价扣费;请求并发为 10,厂商估算用户会话为 40。未用额度受结转规则约束,不是只为实际用量付款。

一美元使用 TTS-2 Flash$1 → 名义 15.22 段

一段约消耗 $0.06568:STT $0.00833 + TTS $0.05000 + LLM $0.00735。这是按给定假设进行的 credits 除法;Inworld 并不单独销售一美元会话包。

一美元使用 TTS-2$1 → 名义 8.64 段

一段约消耗 $0.11568:STT 与 LLM 假设不变,TTS 为 $0.10000。还没计算质量、重试和验收,声音选择就已经会改变费用。

用完 $25 Creator credits380 段 Flash 或 216 段 TTS-2

这是相同 10 分钟负载、账号没有其他用量时的完整段理论上限;不代表 380 或 216 段都通过验收,也不改变请求或会话容量。

先迭代,再请 10 人试玩30 段 → 名义 $1.97–$3.47

假设创作者调试 20 段,再让 10 名玩家各完成一段;当月 Creator 现金支出仍为 $25。20 段迭代只是预算假设,不是首轮成功率或完整 NPC 开发成本。

100 次十分钟访问On-Demand 名义 $9.49–$14.49

按 Creator 单价约消耗 $6.57–$11.57,但现金仍支付 $25;On-Demand 按公开单价计算且未减不清晰的免费量。这里是总共 100 次访问,不是 100 个同时会话。

名义用量不等于合格产出。真正分母是符合角色、任务、声音和玩家体验标准的会话数;真实成本还要加入失败与重试、上下文增长、外部服务、后端、工程和运营。峰值容量要另算:Creator 只列出估算 40 个同时用户会话;100 个同时会话需要更高公开档或经确认的定制方案与负载验证。

商用条件

定价页提供商业许可路径,通用条款也在合规前提下把 Inworld 对输出的权利转让给客户;但同一组公开材料还出现 internal business purposes、终止后删除 Services/Models/Outputs,以及把 Project Files 与 Inworld Platform 绑定的旧 SDK 协议。发行前应确认当前 Runtime 分发、终止后游戏内容、第三方模型/声音权利和缓存音频。本页不是法律意见。

玩家语音和聊天可能进入涉及录音、声音生物识别、研发/训练与第三方模型的数据路径。不要默认普通自助 workspace 等于零保留;应确认玩家告知或同意、地区与年龄要求、DPA/ZDR 设置、删除流程、模型提供商处理方式及账号实际结账条款。

生产风险

投入生产前处理这些问题。

产品正处于代际切换,状态标签并不统一

公开产品主线已从 Character Engine 转向 Agent Runtime 与通用实时服务;WebSocket 可以是 GA,而整体 Realtime API、Router 或 STT 仍带 preview 标签。应确认具体引擎包、changelog 与目标平台,不要用一个 GA 标签代表整套技术栈成熟。

O02O03O04O14O16

识别、抢话和断线都需要可见兜底

历史证据反复出现识别问题、等待、角色抢话和会话停止回应;当前发生率未知。评估沉浸感之前,应先加入字幕、打断处理、超时提示、重试限制、预写对白和退出路径。

U05U06U08U09U10U13

对话不能掌控重要游戏状态

有说服力的角色仍可能说错。任务事实、背包、奖励、战斗、支付和存档应留在确定性系统;工具调用还需要窄权限、Schema 校验、幂等与失败回滚。

O05O06U04U08U10

凭据与玩家数据需要后端方案

不要在客户端打包可重复使用的 Base64 key。后端负责保存凭据并签发短期 token,同时记录哪些文字、音频、元数据和日志离开游戏、保留多久、又会交给哪些模型提供商。

O10O11O12O15O16U01U14

分发与终止条款需要书面确认

商业许可标签、通用服务条款与旧 SDK 协议并没有用同一套措辞回答全部当前 Runtime 分发问题。发行前应按实际套餐确认插件再分发、缓存输出、终止后使用、署名及第三方声音或模型。

O07O09O10O13

尚未验证

本页没有声称完成的事情

研究方法

基于公开资料评估

14 条独立记录覆盖 10 个平台与 5 类证据:开发者/社区案例、玩家与评论记录、两次独立媒体试玩、一项学术研究和一个技术仓库。Steam 占 3/14(21.4%),Reddit 占 2/14(14.3%),没有平台达到一半。还检索了 Epic Developer Community、GameDev.net、G2 与 Hacker News,其中结果为空、过弱、带激励、属于转述或无法完整访问。厂商案例和赞助内容不计入独立数量;重复 demo、同一游戏和论文的早期学位稿已按集群处理或去重。反复出现的历史主题可支持工作流与失败类型判断,但近期精确版本的游戏证据不足;当前 Runtime 实际表现仍为低置信度。

时间范围优先覆盖 2025-09-01 至 2026-09-01;更早的 Character Engine 项目和 demo 只作为历史设计证据,其故障比例不代表当前 Agent Runtime。
官方来源16
  1. O01
    官方来源
    Inworld AI

    当前实时语音、模型路由与 Agent 基础设施入口;厂商性能和排名主张不作为独立结果。

    核验 2026年9月1日
  2. O02
    官方来源
    Introducing the Inworld AI Runtime for Unreal

    Runtime 图、模板、可观测性与 Unreal 发布说明;发布时 Unity 被称为 early access,不代表当前状态保证。

    核验 2026年9月1日
  3. O03
    官方来源
    Unity Agent Runtime quickstart

    搜索索引中的 Unity 要求、包安装、API key 与文字/按键语音示例;核验时直接访问会跳转登录。

    核验 2026年9月1日
  4. O04
    官方来源
    Unreal Agent Runtime quickstart

    搜索索引中的 Unreal 5.4–5.7、C++ 项目、插件、Character/Chat 模板与 trace 要求;核验时直接访问会跳转登录。

    核验 2026年9月1日
  5. O05
    官方来源
    Current Inworld documentation index

    当前 TTS、STT、Router、Realtime API、记忆、back-channel 与工具文档的公开索引。

    核验 2026年9月1日
  6. O06
    官方来源
    Inworld Realtime API

    单会话语音管线、模型选择、工具调用与传输状态;公开延迟数字仍是厂商主张,不是本站游戏实测。

    核验 2026年9月1日
  7. O07
    官方来源
    Inworld pricing

    当前自助月费、credits、TTS/STT 单价、请求限制、估算会话、结转与商业许可标签。

    核验 2026年9月1日
  8. O08
    官方来源
    Inworld model catalog

    当前模型与输入/输出 token 单价;页面预算用 Gemini 2.5 Flash 作透明示例,不代表质量推荐。

    核验 2026年9月1日
  9. O09
    官方来源
    Inworld Terms of Service

    服务许可、输入与输出、材料使用、训练例外、限制、费用及终止要求。

    核验 2026年9月1日
  10. O10
    官方来源
    Inworld service-specific terms

    语音输入、语音输出、User Voice Model、内容权利与禁止健康数据的附加条款。

    核验 2026年9月1日
  11. O11
    官方来源
    Inworld Privacy Policy

    聊天、录音、可能的声音生物识别、研发/训练、保留与跨境处理;企业代处理数据另有适用范围。

    核验 2026年9月1日
  12. O12
    官方来源
    Inworld security

    SOC 2 Type II、加密与 Trust Center 入口;零数据保留不是所有自助套餐的默认能力。

    核验 2026年9月1日
  13. O13
    官方来源
    Inworld SDK License Agreement

    旧公开 SDK 协议,涉及 Project Files、分发与平台限制;是否适用于当前 Agent Runtime 仍需确认。

    核验 2026年9月1日
  14. O14
    官方来源
    Inworld product availability status

    官方状态标签区分 TTS GA、Router/STT research preview、Realtime API research preview 与 WebSocket GA。

    核验 2026年9月1日
  15. O15
    官方来源
    Inworld authentication guidance

    搜索索引建议不要在客户端暴露 Base64 凭据,并由后端签发短期 JWT。

    核验 2026年9月1日
  16. O16
    官方来源
    Official multimodal companion sample

    已归档的官方示例,记录会话后端、WebSocket、重试、超时与保守并发处理;归档不等于 Runtime 已停止。

    核验 2026年9月1日
独立证据记录14
  1. U01
    社区案例
    Adding Inworld AI characters to an existing game

    独立 JavaScript 叙事游戏接入需要 Node token 服务;作者认为基础连接尚可、角色有吸引力,也提醒开放聊天可能偏离主游戏。

    核验 2026年9月1日
  2. U02
    社区案例
    Unity discussion — character-system limitations

    开放世界故事开发者喜欢早期角色设置方式,但质疑其限制能否支持随玩家互动演化的故事。

    核验 2026年9月1日
  3. U03
    社区案例
    Unity3D discussion — connecting AI-driven NPCs

    开发者同时接通 Inworld 与 Convai,但称过程有挑战,并指出 STT—LLM—TTS 三层及持续连接费用。

    核验 2026年9月1日
  4. U04
    社区案例
    Cygnus real-time AI NPC showcase

    游戏团队把 Inworld 语音与自建意图层结合,用于采集、战斗、技能和事件,并明确区分生成对话与可执行 NPC 行为。

    核验 2026年9月1日
  5. U05
    评论平台
    Origins player discussion — engaging until dialogue stopped

    一名玩家觉得官方 Origins demo 很有吸引力,随后报告所有 NPC 停止回应,重启又丢失进度;这是旧 demo 记录。

    核验 2026年9月1日
  6. U06
    评论平台
    Origins player discussion — repeated response failure

    另一名 Origins 玩家报告 NPC 约十分钟后停止回答,只能重启恢复;这是复现线索,不是当前 Runtime 测试。

    核验 2026年9月1日
  7. U07
    评论平台
    Cygnus player review

    一名游玩 29.2 小时的玩家不喜欢游戏中的 AI NPC 接入,并指出它可以关闭;评论也批评其他系统,不能把全部不满归因于 Inworld。

    核验 2026年9月1日
  8. U08
    独立实测
    Axios hands-on with Origins

    记者遇到一次有效的主线交流,也遇到数秒等待、角色抢话与跑题回答;该 demo 仍不足以证明能替代人工对白。

    核验 2026年9月1日
  9. U09
    独立实测
    4Gamer GDC hands-on

    日本记者对比早期口音识别失败与新版现场 demo:仍会循环或误解主题,但对话更连续,也更能引发情绪。

    核验 2026年9月1日
  10. U10
    学术案例
    Player experience with LLM-powered NPCs in VR

    2026 年发表的 48 人 VR 研究使用 2023 年 Inworld 版本;总体体验偏正面,但 77% 报告识别问题,也有明显比例遇到无帮助或错误回答。

    核验 2026年9月1日
  11. U11
    评论平台
    Product Hunt — Lore Machine uses Inworld voice

    产品开发者称为韩国叙事用户选择了 Inworld 声音;这是当前低权重 TTS 线索,不证明游戏 Runtime。

    核验 2026年9月1日
  12. U12
    评论平台
    Product Hunt — Toyo uses Inworld voice

    开发者把 Inworld 声音用于电话 Agent,并认为更接近实时交谈;非游戏案例不能证明 NPC 引擎质量。

    核验 2026年9月1日
  13. U13
    社区案例
    Inworld Community — debugging pipeline latency

    当前 Runtime 用户无法判断哪一段造成延迟;工作人员指向逐节点 debug 日志,但帖子没有记录最终测量结果。

    核验 2026年9月1日
  14. U14
    技术仓库
    Decentraland Inworld SDK7 scene

    独立开源场景包含远端服务器、代理/WebSocket、自定义聊天 UI 与多环境 endpoint;它说明接入粘合工作,不证明输出质量,且使用旧 API 路径。

    核验 2026年9月1日

商业披露

这项研究如何获得支持

Owner Review 于 2026 年 9 月 1 日通过,接受本页有边界的公开资料评估与中等置信度结论。本轮未引入联盟链接、赞助、厂商账号、免费额度、设备、采访或技术支持,也没有测试 Inworld SDK 或模型。Owner 既有使用经验和商业关系仍未声明;审核通过不等于解决页面列出的 Runtime、价格、分发与数据未知。

资料评估与 Owner Review 已完成。

本页已作为公开资料评估发布。结论会随定价、条款、产品版本和重要新证据变化而复核。