01
会议论文
CVPR 2026
Wavelet-based Frame Selection by Detecting Semantic Boundary for Long Video Understanding
Wang Chen, Yuhui Zeng, Yongdong Luo, Tianyu Xie, Luojun Lin, Jiayi Ji, Yan Zhang, Xiawu Zheng
从有噪声的查询-帧相关性信号中检测语义边界,再按片段重要性分配帧预算。方法无需训练,在 VideoMME、MLVU 与 LongVideoBench 上分别提升 5.5、9.5 与 6.2 个百分点。
AAAI 2026 · Equal contribution
QuoTA: Query-oriented Token Assignment via CoT Query Decouple for Long Video Comprehension
Yongdong Luo*, Wang Chen*, Weizhong Huang, Shukang Yin, Haojia Lin, Jinfa Huang, Chaoyou Fu, Jiayi Ji, Xiawu Zheng, Jiebo Luo
在跨模态交互前,根据查询对各帧分配视觉 token。CoT 将复杂问题拆成可判定线索,同等 token 预算下在六个视频基准上平均提升 3.2 个百分点。
ICASSP 2023 · Equal contribution
Customized Automatic Face Beautification
Wang Chen*, Peizhen Chen*, Weijie Chen, Luojun Lin
提出由人脸美学预测模型引导的 StyleGAN 反演,根据用户给出的目标分数做定制化人脸修饰,同时尽量保留身份信息。
ICML 2026
Training-Free Multimodal Large Language Model Orchestration
Tianyu Xie, Yuexiao Ma, Yuhang Wu, Wang Chen, Jiayi Ji, Tat-Seng Chua, Xiawu Zheng, Rongrong Ji
通过语言模型控制器、文本化跨模态记忆和全双工交互层,在不额外训练的情况下组合现成的模态专家。
02
预印本
arXiv preprint · Equal contribution
Event-Anchored Frame Selection for Effective Long-Video Understanding
Wang Chen*, Yongdong Luo*, Yuhui Zeng, Luojun Lin, Tianyu Xie, Fei Chao, Rongrong Ji, Xiawu Zheng
先把视频划成视觉一致的事件,再为每个事件定位查询相关锚点,最后用自适应 MMR 做全局补充,在覆盖、相关性和多样性之间取得平衡。
SSRN preprint
Real-Time Interactive Face Beautification
Luojun Lin, Wang Chen, Peizhen Chen, Xiawu Zheng, Lianwen Jin
构造美学超平面,并在潜空间中直接插值,使用户可以实时调整目标美学分数,同时尽量保留身份特征。
arXiv preprint
SocialOmni: Benchmarking Audio-Visual Social Interactivity in Omni Models
Tianyu Xie, Jinfa Huang, Yuexiao Ma, Rongfang Luo, Yan Yang, Wang Chen, Yuhui Zeng, Yixuan Zou, Qingchuan Ma, Zhiqiang Lu, Ruize Fang, Xiawu Zheng, Jiebo Luo, Rongrong Ji
从说话人感知、打断时机与回应方式评测音视频社交交互,并分析感知准确率与最终交互质量之间的差距。
arXiv preprint
WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation
Yuhui Zeng, Wang Chen, Jinfa Huang, Tianyu Xie, Yongdong Luo, Jiayi Ji, Xiawu Zheng, Jiebo Luo
用时空解耦的小波分析分配帧级预算并压缩空间 token,关注高压缩率下的性能保留。
arXiv preprint
One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding
Wang Chen, Yu Chen, Xiang Wang, Shuai Li, Jinfa Huang, Xiawu Zheng
生成一条可被任意预算截断的帧优先序列,使证据从局部线索逐步扩展到时间上下文,并降低重复选帧的延迟。
作者顺序与发表状态按论文页面核对。* 表示共同贡献。预印本不会以投稿中的会议名称标注。