让玩家说,让角色回答
在同一会话中把麦克风音频依次送入语音识别、选定 LLM 与 TTS。回合判断和流式传输减少基础拼装,但游戏中的真实延迟仍受模型、网络、上下文和客户端影响。
O05O06把语音、语言模型与游戏动作连起来,先做一个有边界的实时 NPC。
应用介绍
Inworld AI 是面向实时互动 Agent 的运行时技术栈。它可以接收玩家麦克风声音,转成文字,把对话与角色上下文交给选定语言模型,再把生成回答以流式语音返回;记忆、知识、回合判断、附和反馈和工具调用也可以放在同一条可观察管线中。
Unity 与 Unreal 模板提供了较短的对话角色起步路径。你定义职责、声音、动机与限制,连接 Runtime,再从文字或按键说话示例开始。角色模型、动画、导航、任务事实、动作权限、奖励和存档仍由游戏负责;Inworld 不是一个自动生成完整 NPC 或完整游戏系统的按钮。
因此,即使不会自行搭建整套 STT—LLM—TTS 系统,也可以从第一个语音 NPC 开始。先在小场景做一个讲解员、证人、陪伴角色或可选提示角色。对话要触发动作、服务更多玩家时,代码与引擎判断会越来越重要,但它们不是探索第一个受限互动的入场资格。
搜索索引中的 Unity 路径最低为 Unity 2022.3 LTS,推荐 6000.0.41 或更新;Unreal 路径列出 5.4–5.7 与 C++ 项目。两者都从 API key 和示例角色开始。核验时当前引擎文档会跳转登录,因此改动生产项目之前应在账号内确认包版本与发布说明。
在同一会话中把麦克风音频依次送入语音识别、选定 LLM 与 TTS。回合判断和流式传输减少基础拼装,但游戏中的真实延迟仍受模型、网络、上下文和客户端影响。
O05O06角色上下文、知识、对话历史、长期记忆与声音指令都能影响回答;更长上下文也可能增加 token 用量,生成陈述不能直接作为权威游戏事实。
O05O06O08Runtime 可以在不中断语音会话的情况下请求已注册工具。每次请求都应视为提议,由游戏校验动作、参数、权限和最终状态变化。
O02O05O06U04搜索索引中的 Quickstart 包括 Unity 文字/按键语音示例,以及 Unreal Character/Chat 模板。正式发布仍需处理版本兼容、凭据后端、日志、重连和目标设备检查。
O03O04O15O16官方界面与示例
TTS Playground 示例将文本输入、模型与声音选择、语速控制和音频预览放在一起。
首个受限语音 NPC、小型 Unity/Unreal 原型,以及透明的公开单价预算。本页不证明当前中文质量、端到端延迟、长时稳定性、生产并发、实测账单或合格会话成功率。
入门范围:以引擎示例或 WebSocket 模板搭建一个受限语音 NPC。
Agent 范围:建立语音/文本会话并接收输出事件。
判断置信度:入门 中 · Agent 中
两项为独立的编辑判断,不是综合评分,也不代表本站已完成 Agent 接入测试。
关键发现
编辑结论
如果语音交谈本身就是游戏体验的一部分,而你不想从零拼接语音识别、语言模型和语音输出,Inworld 值得作为候选。它也给新手提供了真实起点:先在小场景做一个只负责一件事的角色。奖励、背包、战斗、任务完成和存档应留在确定性的游戏逻辑中。当前 Agent Runtime 比多数独立游戏证据更新,因此在把它变成核心生产依赖之前,应先完成小型原型。
更适合
不太适合
工作流定位
选择讲解员、证人、陪伴角色或提示角色,写清它知道什么、不能声称什么,以及最多可以请求哪个低风险工具。在接入更大场景前,先准备职责内、职责外和打断类问题。
在可丢弃项目副本中使用当前 Unity 文字/按键语音示例或 Unreal Chat 模板。先加入字幕、一个无副作用动作和逐阶段日志,再增加自定义动画、记忆或多个角色。
邀请少量玩家,记录识别结果、首段音频时间、完整回答时间、打断、工具验收、断线和 credits,再据此估算合格会话成本与峰值容量。
推荐工作流
从可验证的 Brief 开始,逐步完成原型、资产、音频、测试与发布,并明确每一步的交接物和人工检查。
最短验证路径
以下是根据本轮证据整理出的低风险起步方法。
选择一个职责清楚的角色,写一份简短事实表:身份、已知事实、禁止声称的内容、语气,以及唯一允许请求的工具。
准备二十条输入,覆盖普通对话、职责边界、重复提问、打断、沉默、中文或口音需求,以及未授权动作请求。
在可丢弃项目副本中接通当前 Unity 或 Unreal 示例。凭据放在后端,加入字幕,只暴露一个没有不可逆副作用的动作。
在目标网络和设备运行这些输入,记录转写、首段音频、完整回答、规则遵从、工具校验、重连行为和真实 credits。
再让少量玩家体验同一受限场景。定义合格会话并算清真实成本、峰值会话、隐私告知与预写兜底后,才扩大开放。
价格与权利
价格与条款最后核验:2026年9月1日
这是公开单价算式,不是实测账单:一段 10 分钟会话包含玩家说 5 分钟、NPC 说 5 分钟(5,000 字符)、10 个回合、12,000 输入 token 与 1,500 输出 token;LLM 使用 Gemini 2.5 Flash,每 100 万输入/输出 token 为 $0.30 / $2.50。不减免费量,也不含重试、记忆/RAG 增长、审核、工具、后端、税和人工。
O07O08实付 $25,获得 $25 月度 credits,并按 Creator 单价扣费;请求并发为 10,厂商估算用户会话为 40。未用额度受结转规则约束,不是只为实际用量付款。
一段约消耗 $0.06568:STT $0.00833 + TTS $0.05000 + LLM $0.00735。这是按给定假设进行的 credits 除法;Inworld 并不单独销售一美元会话包。
一段约消耗 $0.11568:STT 与 LLM 假设不变,TTS 为 $0.10000。还没计算质量、重试和验收,声音选择就已经会改变费用。
这是相同 10 分钟负载、账号没有其他用量时的完整段理论上限;不代表 380 或 216 段都通过验收,也不改变请求或会话容量。
假设创作者调试 20 段,再让 10 名玩家各完成一段;当月 Creator 现金支出仍为 $25。20 段迭代只是预算假设,不是首轮成功率或完整 NPC 开发成本。
按 Creator 单价约消耗 $6.57–$11.57,但现金仍支付 $25;On-Demand 按公开单价计算且未减不清晰的免费量。这里是总共 100 次访问,不是 100 个同时会话。
名义用量不等于合格产出。真正分母是符合角色、任务、声音和玩家体验标准的会话数;真实成本还要加入失败与重试、上下文增长、外部服务、后端、工程和运营。峰值容量要另算:Creator 只列出估算 40 个同时用户会话;100 个同时会话需要更高公开档或经确认的定制方案与负载验证。
定价页提供商业许可路径,通用条款也在合规前提下把 Inworld 对输出的权利转让给客户;但同一组公开材料还出现 internal business purposes、终止后删除 Services/Models/Outputs,以及把 Project Files 与 Inworld Platform 绑定的旧 SDK 协议。发行前应确认当前 Runtime 分发、终止后游戏内容、第三方模型/声音权利和缓存音频。本页不是法律意见。
玩家语音和聊天可能进入涉及录音、声音生物识别、研发/训练与第三方模型的数据路径。不要默认普通自助 workspace 等于零保留;应确认玩家告知或同意、地区与年龄要求、DPA/ZDR 设置、删除流程、模型提供商处理方式及账号实际结账条款。
生产风险
公开产品主线已从 Character Engine 转向 Agent Runtime 与通用实时服务;WebSocket 可以是 GA,而整体 Realtime API、Router 或 STT 仍带 preview 标签。应确认具体引擎包、changelog 与目标平台,不要用一个 GA 标签代表整套技术栈成熟。
O02O03O04O14O16历史证据反复出现识别问题、等待、角色抢话和会话停止回应;当前发生率未知。评估沉浸感之前,应先加入字幕、打断处理、超时提示、重试限制、预写对白和退出路径。
U05U06U08U09U10U13有说服力的角色仍可能说错。任务事实、背包、奖励、战斗、支付和存档应留在确定性系统;工具调用还需要窄权限、Schema 校验、幂等与失败回滚。
O05O06U04U08U10不要在客户端打包可重复使用的 Base64 key。后端负责保存凭据并签发短期 token,同时记录哪些文字、音频、元数据和日志离开游戏、保留多久、又会交给哪些模型提供商。
O10O11O12O15O16U01U14商业许可标签、通用服务条款与旧 SDK 协议并没有用同一套措辞回答全部当前 Runtime 分发问题。发行前应按实际套餐确认插件再分发、缓存输出、终止后使用、署名及第三方声音或模型。
O07O09O10O13尚未验证
研究方法
14 条独立记录覆盖 10 个平台与 5 类证据:开发者/社区案例、玩家与评论记录、两次独立媒体试玩、一项学术研究和一个技术仓库。Steam 占 3/14(21.4%),Reddit 占 2/14(14.3%),没有平台达到一半。还检索了 Epic Developer Community、GameDev.net、G2 与 Hacker News,其中结果为空、过弱、带激励、属于转述或无法完整访问。厂商案例和赞助内容不计入独立数量;重复 demo、同一游戏和论文的早期学位稿已按集群处理或去重。反复出现的历史主题可支持工作流与失败类型判断,但近期精确版本的游戏证据不足;当前 Runtime 实际表现仍为低置信度。
当前实时语音、模型路由与 Agent 基础设施入口;厂商性能和排名主张不作为独立结果。
Runtime 图、模板、可观测性与 Unreal 发布说明;发布时 Unity 被称为 early access,不代表当前状态保证。
搜索索引中的 Unity 要求、包安装、API key 与文字/按键语音示例;核验时直接访问会跳转登录。
搜索索引中的 Unreal 5.4–5.7、C++ 项目、插件、Character/Chat 模板与 trace 要求;核验时直接访问会跳转登录。
当前 TTS、STT、Router、Realtime API、记忆、back-channel 与工具文档的公开索引。
单会话语音管线、模型选择、工具调用与传输状态;公开延迟数字仍是厂商主张,不是本站游戏实测。
当前自助月费、credits、TTS/STT 单价、请求限制、估算会话、结转与商业许可标签。
当前模型与输入/输出 token 单价;页面预算用 Gemini 2.5 Flash 作透明示例,不代表质量推荐。
服务许可、输入与输出、材料使用、训练例外、限制、费用及终止要求。
语音输入、语音输出、User Voice Model、内容权利与禁止健康数据的附加条款。
聊天、录音、可能的声音生物识别、研发/训练、保留与跨境处理;企业代处理数据另有适用范围。
SOC 2 Type II、加密与 Trust Center 入口;零数据保留不是所有自助套餐的默认能力。
旧公开 SDK 协议,涉及 Project Files、分发与平台限制;是否适用于当前 Agent Runtime 仍需确认。
官方状态标签区分 TTS GA、Router/STT research preview、Realtime API research preview 与 WebSocket GA。
搜索索引建议不要在客户端暴露 Base64 凭据,并由后端签发短期 JWT。
已归档的官方示例,记录会话后端、WebSocket、重试、超时与保守并发处理;归档不等于 Runtime 已停止。
独立 JavaScript 叙事游戏接入需要 Node token 服务;作者认为基础连接尚可、角色有吸引力,也提醒开放聊天可能偏离主游戏。
开放世界故事开发者喜欢早期角色设置方式,但质疑其限制能否支持随玩家互动演化的故事。
开发者同时接通 Inworld 与 Convai,但称过程有挑战,并指出 STT—LLM—TTS 三层及持续连接费用。
游戏团队把 Inworld 语音与自建意图层结合,用于采集、战斗、技能和事件,并明确区分生成对话与可执行 NPC 行为。
一名玩家觉得官方 Origins demo 很有吸引力,随后报告所有 NPC 停止回应,重启又丢失进度;这是旧 demo 记录。
另一名 Origins 玩家报告 NPC 约十分钟后停止回答,只能重启恢复;这是复现线索,不是当前 Runtime 测试。
一名游玩 29.2 小时的玩家不喜欢游戏中的 AI NPC 接入,并指出它可以关闭;评论也批评其他系统,不能把全部不满归因于 Inworld。
记者遇到一次有效的主线交流,也遇到数秒等待、角色抢话与跑题回答;该 demo 仍不足以证明能替代人工对白。
日本记者对比早期口音识别失败与新版现场 demo:仍会循环或误解主题,但对话更连续,也更能引发情绪。
2026 年发表的 48 人 VR 研究使用 2023 年 Inworld 版本;总体体验偏正面,但 77% 报告识别问题,也有明显比例遇到无帮助或错误回答。
产品开发者称为韩国叙事用户选择了 Inworld 声音;这是当前低权重 TTS 线索,不证明游戏 Runtime。
开发者把 Inworld 声音用于电话 Agent,并认为更接近实时交谈;非游戏案例不能证明 NPC 引擎质量。
当前 Runtime 用户无法判断哪一段造成延迟;工作人员指向逐节点 debug 日志,但帖子没有记录最终测量结果。
独立开源场景包含远端服务器、代理/WebSocket、自定义聊天 UI 与多环境 endpoint;它说明接入粘合工作,不证明输出质量,且使用旧 API 路径。
商业披露
Owner Review 于 2026 年 9 月 1 日通过,接受本页有边界的公开资料评估与中等置信度结论。本轮未引入联盟链接、赞助、厂商账号、免费额度、设备、采访或技术支持,也没有测试 Inworld SDK 或模型。Owner 既有使用经验和商业关系仍未声明;审核通过不等于解决页面列出的 Runtime、价格、分发与数据未知。
本页已作为公开资料评估发布。结论会随定价、条款、产品版本和重要新证据变化而复核。