JD JoyAI
JoyAI-VL-Interaction 是京东 Joy Future Academy 开源的实时视频语言交互系统。仓库发布了 8B 规模、以视觉为核心的交互模型、训练配方、时间对齐交互数据和完整可部署技术栈。它面向摄像头或直播流输入,持续观察,并每秒自主判断是说话、保持静默还是委托,在重要视觉事件发生时以亚秒级响应。系统基于 JoyAI-VL-8B、WebRTC 流、vLLM/vLLM-Omni 基础设施、可选 ASR/TTS 服务和后台 Agent 服务构建。README 表示其行为来自超过 400 万条时间对齐片段,并通过强化学习优化。
编辑结论
适合探索主动摄像头、直播流、监控提醒、烹饪指导、实时解说和事件驱动视觉交互系统的研究者与产品团队。
如果需要成熟托管助手、低资源移动端部署,或只需要通用离线视频描述模型,就不适合优先选择它。
JoyAI-VL-Interaction 值得独立建档,因为它发布的是完整实时交互模型和系统栈,而不只是静态 VLM 权重。
Apache-2.0 open-source model, dataset and deployable system; self-hosted GPU inference required
GitHub repository, Hugging Face model download, Hugging Face dataset download, Self-hosted GPU inference
商用应遵守当前产品、API、模型许可证和计费条款。
处理敏感负载前,请核验提示词、文件、媒体上传、保留和训练使用条款。
持续观察摄像头或直播流,在重要视觉事件发生时主动开口。
可用于游戏直播解说、烹饪过程指导、直播弹幕式评论等时机敏感的视频交互。
可利用开放模型、数据和训练配方研究主动视觉语言行为与时间对齐交互训练。
模型名称、额度、发布状态、区域接入和商用条款变化较快,采购或生产使用前请重新核验官方来源。
qwen
qwen-agentworld
gemini
doubao-ark
omnihuman-video
official · en · verified 2026-08-04
确认 2026-06-20 完整开源发布、8B 模型、可部署技术栈、时间对齐数据、vLLM-Omni 支持、亚秒级延迟定位和 Apache-2.0 许可证。
benchmark · en · verified 2026-06-25
官方 README 链接的实时视觉语言交互智能技术报告。
最后核验: 2026-08-04