视频创作正在被可实时编辑改写。8月5日,京东宣布开源自研的实时流式视频编辑模型JoyAI-Video-Edit,让用户可以一边观看视频,一边修改人物穿搭、替换商品和场景。


京东方面回应新京报贝壳财经记者,该开源技术向开发者及内容创作者开放。不同于传统“先完成素材再进行后期修改”的视频生产逻辑,新技术实现了“边预览、边创作”的模式,能够适配直播电商、短视频带货、家装设计等电商业务场景。


记者实测:绿色T恤秒变粉色,动作略有延时


新京报贝壳财经记者实测发现,用户打开摄像头,只需在文本框内写入“仅将上衣换为白色圆领纯棉T恤,可见棉质纹理”一类的指令,模型便可在视频播放的同时,对人物外观进行即时替换,无需重新剪辑或等待成片导出。


图/记者实测截图。

 

在第一组实测中,记者佩戴眼镜、身穿绿色T恤自拍,输入指令“将上衣的描述改为‘粉色’”,模型便实时将画面中人物的整件绿色T恤替换为粉色。记者继续体验,点击“戴上写有‘京东’字样的红色棒球帽与深色镜片墨镜”的指令,右边视频也实时进行了饰品佩戴操作。不过实时生成画面的动作,相比原始视频存在轻微延时。


从实测效果与模型交互界面来看,JoyAI-Video-Edit可覆盖多项高频视频编辑功能:支持实时替换视频人物的衣物颜色、款式与面料;可同步调整发型、帽子、眼镜等配饰,完成人物外貌改造;能够精细调控棉质纹理、皮革反光等服装材质质感;可把写实视频转换成动画、插画、电影等不同艺术风格;也可完成实景与虚拟背景之间的场景置换,实现人物形象向其他真人或虚拟角色的转换,同时还支持参考图驱动换装,上传参考图片即可复刻对应形象到视频主体上。


适配电商直播等场景,实用门槛仍在提示词质量


视频实时编辑首先要解决速度问题。视频由一帧帧连续画面组成,如果模型处理速度跟不上播放速度,就会出现卡顿与延迟。


京东探索研究院相关负责人表示,JoyAI-Video-Edit基于全自研JoyAI-Video模型,在720P分辨率下实现每秒30帧的模型推理速度,能够在保持较高画面清晰度的同时,跟上常见影视视频的播放节奏。


从记者的两组实测看,该模型的“实用门槛”仍在于提示词质量。同一段视频,仅改变上衣颜色的描述(白色/粉色),模型便迅速给到对应的版本;但若提示词过于笼统,如只写“换一身衣服”,模型则可能“擅自”补充未明确要求的配饰、变换发型,甚至影响画面整体风格。换言之,模型听得懂,但听得“有点多”——使用者需要更精细的提示词描述来锁定编辑范围。


记者发现,该模型在体验页给出了一组预设场景按钮:实时换装、参考图换装、风格演绎、外貌改造、质感变身、场景切换、主角变身,记者对照实测发现,这七个场景基本上覆盖了电商直播、家装设计这类对成品确定性要求高的场景。


主流厂商重在“文生视频”,京东押注“边播边改”


新京报贝壳财经记者梳理发现,自2024年OpenAI Sora引爆AI视频生成赛道以来,国内主流厂商在文生视频、图生视频领域能力快速迭代:阿里通义万相2.1于2025年2月全面开源14B与1.3B参数版本;快手可灵AI迭代至2.5Turbo版本,全球用户超4500万,2025年第三季度营收超3亿元;依托Seedance多模态模型的字节即梦AI,与抖音、剪映深度打通,第三方统计显示2025年3月其月活跃用户达893万。


相比之下,主流玩家押注的多为“先有素材再生成”,即上传图片、文字或脚本,一键生成一段新视频;而JoyAI-Video-Edit选择押注“先有视频,再边播边改”。


京东的另一层用意,在于拓展具身智能的训练数据。上述负责人透露,JoyAI-Video-Edit还为具身智能数据大规模合成提供了新的技术路径。机器人训练需要大量物体抓取、搬运与操作视频,但真机数据采集成本较高,危险或少见场景也难以反复采集。依托对场景、物体与画面内容的可控编辑能力,JoyAI-Video-Edit可将人手操作视频转化为机械手或机械臂操作素材,并在保留物体位置、空间关系与动作轨迹的基础上,替换场景、物体与机器人形态,让一段视频扩展出更多训练样本。


新京报贝壳财经记者梳理发现,京东已搭建起面向物理世界的JoyAI模型矩阵:JoyAI‑Image‑Edit负责空间理解与图像编辑,JoyAI‑Echo聚焦长音视频生成,JoyAI‑VL‑Interaction可实现AI持续观察画面并实时反馈,JoyAI‑Talker承担实时语音交互能力,JoyAI‑RA面向机器人操控。此次开源的JoyAI-Video-Edit补齐实时视频编辑能力,也是该矩阵中首个支持任意时长视频流式编辑的模型。

 

新京报贝壳财经记者 程子姣

编辑 杨娟娟

校对 穆祥桐