9月9日的京东全球科技探索者大会(JDD)上,京东探索研究院端出了 JoyAI-Echo 系列的两项新进展:超长音视频生成模型升到 JoyAI-Echo1.5,同时发布并开源可交互视听世界模型 EchoWM。前者把音视频持续生成拉过10分钟门槛,后者把原生视听生成和用户控制拧在一起,让 AI 内容从"能看"进一步走到"能进、能探索"。
长视频这条线,JoyAI-Echo1.5押的是音视频 Memory Bank 架构。它能在多镜头、长时程的生成里死死抓住人物形象、声音和故事线索不跑偏,撑住10分钟以上的音视频持续产出。模型靠长视频后训练把推理速度最高拉了7.5倍,只需要2张 H200,就能在480P 下平均每秒生成24帧,做到1:1等时生成;Director Agent 还能按自然语言完成故事展开、分镜规划、生成审核和成片组装这一整套活。

世界模型这边通常分两路走:一路能跟着用户操作不停生成画面,却缺了自然声音;另一路能联合生成音视频,可用户很难持续钻进去改内容。EchoWM 把这两类能力并在了一起,原生联合生成720P 视频、环境音、音乐和语音,让声音随场景、摄像机和主体运动同步变;通过统一的"相机意图",模型同时支持第一人称导航、第三人称摄像机与主体协同控制,以及多轮连续探索。在 WBench Navigation 评测里,EchoWM 和四步因果流式版本 EchoWM-Flash 包揽前两名,其中 EchoWM 在涵盖158个多轮导航案例的榜单上拿下综合第一。
底座层面,京东这次集中亮出 JoyAI 基础模型矩阵,能力覆盖图像与视频生成、多模态理解、实时交互、世界建模、智能语音和具身操作,把 JoyAI 从内容生成往动态环境的感知、模拟与交互推。JDD 现场还展示了新一代音视频基础模型 JoyAI-Video,重点强化商业视频生成、物理规律呈现、第一人称视角和多镜头连续叙事,瞄准电商广告、短剧创作和具身智能演练,计划10月正式发布。模型之外,京东同步展出了 EgoLive 真实数据、JoyAI-Sim 仿真转换工具链和大模型基础设施,搭起从真实数据、仿真转换到模型研发的支撑体系。
产业落地上,零售、物流、医疗、工业、政务五大行业模型和智能体集中亮相:零售多模态模型管图搜、智能导购和素材质检;物流超脑3.0用 Agentic 框架把决策、流程和物理执行串起来;京医千询3.0强化医疗影像分析、模拟问诊和可信推理;工业大模型扎进专业选型、维保和 CAD 设计;政务大模型服务政策咨询、智能办公和数据分析。基础模型创新与产业 AI 实践双线推进,构成了京东把 AI 从数字世界推向物理世界的整体布局。