Publications

论文与预印本

陈旺关于长视频理解、多模态推理与生成式视觉的论文与预印本。

01

会议论文

WFS-SB 方法示意图,展示查询相关性信号、小波变换和语义边界2026

CVPR 2026

Wavelet-based Frame Selection by Detecting Semantic Boundary for Long Video Understanding

Wang Chen, Yuhui Zeng, Yongdong Luo, Tianyu Xie, Luojun Lin, Jiayi Ji, Yan Zhang, Xiawu Zheng

从有噪声的查询-帧相关性信号中检测语义边界,再按片段重要性分配帧预算。方法无需训练,在 VideoMME、MLVU 与 LongVideoBench 上分别提升 5.5、9.5 与 6.2 个百分点。

QuoTA 在不同视觉 token 预算下的性能曲线2026

AAAI 2026 · Equal contribution

QuoTA: Query-oriented Token Assignment via CoT Query Decouple for Long Video Comprehension

Yongdong Luo*, Wang Chen*, Weizhong Huang, Shukang Yin, Haojia Lin, Jinfa Huang, Chaoyou Fu, Jiayi Ji, Xiawu Zheng, Jiebo Luo

在跨模态交互前,根据查询对各帧分配视觉 token。CoT 将复杂问题拆成可判定线索,同等 token 预算下在六个视频基准上平均提升 3.2 个百分点。

定制化人脸美化方法流程,展示人脸编码、重建与美学模型引导2023

ICASSP 2023 · Equal contribution

Customized Automatic Face Beautification

Wang Chen*, Peizhen Chen*, Weijie Chen, Luojun Lin

提出由人脸美学预测模型引导的 StyleGAN 反演,根据用户给出的目标分数做定制化人脸修饰,同时尽量保留身份信息。

免训练多模态大模型编排流程,展示统一输入、LLM 编排与统一输出2026

ICML 2026

Training-Free Multimodal Large Language Model Orchestration

Tianyu Xie, Yuexiao Ma, Yuhang Wu, Wang Chen, Jiayi Ji, Tat-Seng Chua, Xiawu Zheng, Rongrong Ji

通过语言模型控制器、文本化跨模态记忆和全双工交互层,在不额外训练的情况下组合现成的模态专家。

02

预印本

EFS 事件划分、锚点定位与全局优化流程图2026

arXiv preprint · Equal contribution

Event-Anchored Frame Selection for Effective Long-Video Understanding

Wang Chen*, Yongdong Luo*, Yuhui Zeng, Luojun Lin, Tianyu Xie, Fei Chao, Rongrong Ji, Xiawu Zheng

先把视频划成视觉一致的事件,再为每个事件定位查询相关锚点,最后用自适应 MMR 做全局补充,在覆盖、相关性和多样性之间取得平衡。

实时交互式人脸美化示意图,展示目标分数与潜空间美学超平面插值2024

SSRN preprint

Real-Time Interactive Face Beautification

Luojun Lin, Wang Chen, Peizhen Chen, Xiawu Zheng, Lianwen Jin

构造美学超平面,并在潜空间中直接插值,使用户可以实时调整目标美学分数,同时尽量保留身份特征。

SocialOmni 基准概览、任务设计与全模态模型表现2026

arXiv preprint

SocialOmni: Benchmarking Audio-Visual Social Interactivity in Omni Models

Tianyu Xie, Jinfa Huang, Yuexiao Ma, Rongfang Luo, Yan Yang, Wang Chen, Yuhui Zeng, Yixuan Zou, Qingchuan Ma, Zhiqiang Lu, Ruize Fang, Xiawu Zheng, Jiebo Luo, Rongrong Ji

从说话人感知、打断时机与回应方式评测音视频社交交互,并分析感知准确率与最终交互质量之间的差距。

WaveZip 小波时空解耦视频 token 压缩流程2026

arXiv preprint

WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation

Yuhui Zeng, Wang Chen, Jinfa Huang, Tianyu Xie, Yongdong Luo, Jiayi Ji, Xiawu Zheng, Jiebo Luo

用时空解耦的小波分析分配帧级预算并压缩空间 token,关注高压缩率下的性能保留。

MEC 可复用稀疏索引、证据发现与套娃式任意预算帧排序方法2026

arXiv preprint

One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding

Wang Chen, Yu Chen, Xiang Wang, Shuai Li, Jinfa Huang, Xiawu Zheng

生成一条可被任意预算截断的帧优先序列,使证据从局部线索逐步扩展到时间上下文,并降低重复选帧的延迟。

作者顺序与发表状态按论文页面核对。* 表示共同贡献。预印本不会以投稿中的会议名称标注。