关于我

陈旺Wang Chen

厦门大学 MAC 实验室人工智能方向博士生

我研究长时程视觉信息怎样进入多模态模型,也关心生成能否帮助模型理解世界。眼下的问题很具体。模型该怎样从连续视频中保留事件结构,怎样生成可检查的候选解释,又怎样回到原始证据里修正它们。

Xiamen, China2026 年 5 月起在高德地图(阿里巴巴集团)实习公众号「AI骇客」也是我偶尔运营的
陈旺在山湖边的个人照片
Wang Chen研究与生活

研究愿景

理解不断展开的世界

我希望构建能在现实时间尺度上持续看见、组织并理解多模态信息的系统。研究从长视频中的事件结构出发,进一步探究生成怎样提出可检验的假设,以及模型怎样在持续到来的视觉流中积累而不遗失证据。

01

现实中的视觉经验很少被整齐地切成一张张图片。一次实验、一段旅程或一场比赛会持续很久,真正影响判断的线索却只在少数时刻出现。模型需要知道哪里发生了变化,也要记得这些变化前后怎样相连。我的第一条研究线索由此展开。我尝试把视频里的语义边界、事件锚点和查询相关信息组织起来,让有限输入保留足够完整的故事。

02

生成给这条路线补上了另一种可能。模型可以先提出事件描述、缺失状态或未来走向,再回到观测中寻找支持与冲突。这样的生成结果只是一组候选,价值来自它让模糊的内部状态变得可以检查。一个候选若找不到时间位置、视觉实体或前后因果的支持,就应该被修改或舍弃。理解因此有了可操作的中间对象。

03

我最终想做的系统,应当能一边接收持续到来的视频,一边维护对事件的当前理解。它知道哪些内容已经确认,哪些仍是假设,旧证据在什么时候需要重新查看。模型给出的答案只是这一过程的一个出口。更重要的是,答案背后的事件表示能够随着新信息到来继续更新,并保留足够清楚的证据来路。

研究

一条正在形成的研究路线

从连续视频里的事件结构出发,让生成提出候选,再让证据完成核验。

01

看见

从连续视觉流中找到结构

把视频当作事件沿时间展开,而非彼此孤立的帧。语义边界、事件锚点和长期记忆共同决定模型究竟看见了什么。

EFSWFS-SB
02

生成

把模糊理解变成可检查的候选

让模型生成事件描述、缺失状态或可能的未来,把尚未成形的判断写成能够被定位、比较和否证的中间对象。

Generative understandingHypothesis grounding
03

核验

让理解随着证据继续更新

把候选重新放回时间线和原始视觉证据中检查。保留得到支持的部分,修正冲突之处,并在长时程场景里持续更新事件记忆。

Evidence tracingStreaming video understanding
展开研究脉络

Publications

精选工作

这些工作从不同尺度保留视频里的事件、边界与查询线索,也构成下一步研究的证据基础。

WFS-SB 方法示意图,展示查询相关性信号、小波变换和语义边界2026

CVPR 2026

Wavelet-based Frame Selection by Detecting Semantic Boundary for Long Video Understanding

Wang Chen, Yuhui Zeng, Yongdong Luo, Tianyu Xie, Luojun Lin, Jiayi Ji, Yan Zhang, Xiawu Zheng

从有噪声的查询-帧相关性信号中检测语义边界,再按片段重要性分配帧预算。方法无需训练,在 VideoMME、MLVU 与 LongVideoBench 上分别提升 5.5、9.5 与 6.2 个百分点。

QuoTA 在不同视觉 token 预算下的性能曲线2026

AAAI 2026 · Equal contribution

QuoTA: Query-oriented Token Assignment via CoT Query Decouple for Long Video Comprehension

Yongdong Luo*, Wang Chen*, Weizhong Huang, Shukang Yin, Haojia Lin, Jinfa Huang, Chaoyou Fu, Jiayi Ji, Xiawu Zheng, Jiebo Luo

在跨模态交互前,根据查询对各帧分配视觉 token。CoT 将复杂问题拆成可判定线索,同等 token 预算下在六个视频基准上平均提升 3.2 个百分点。

EFS 事件划分、锚点定位与全局优化流程图2026

arXiv preprint · Equal contribution

Event-Anchored Frame Selection for Effective Long-Video Understanding

Wang Chen*, Yongdong Luo*, Yuhui Zeng, Luojun Lin, Tianyu Xie, Fei Chao, Rongrong Ji, Xiawu Zheng

先把视频划成视觉一致的事件,再为每个事件定位查询相关锚点,最后用自适应 MMR 做全局补充,在覆盖、相关性和多样性之间取得平衡。

查看全部论文

正在研究

正在追问的两个问题

下面是进行中的方向,只写问题和目标,结果留给实验。

A

生成怎样帮助理解

研究生成目标、内部生成特征与候选假设怎样暴露模型尚未理解的部分,再用原始观测定位、核验和修正。

B

长时程流式视频理解

面向持续到来的视频,探索分层记忆、事件更新与证据回看,使模型在低延迟约束下保持长期理解。

News

近况

  1. 进入厦门大学人工智能博士阶段,开始新的 PhD 生活。

  2. 加入高德地图(阿里巴巴集团)实习,关注多模态与视频理解。

  3. WFS-SB 被 CVPR 2026 接收,代码已开源。

  4. QuoTA 发表在 AAAI 2026。

Blog

最近在写

进入文章归档

Timeline

经历

2026.09 起

厦门大学 · 人工智能 · 博士阶段

MAC 实验室,导师曹刘娟教授、郑侠武副教授

2024.09 - 2026.08

厦门大学 · 人工智能 · 硕博连读阶段

在长视频理解与多模态推理方向开展研究

2026.05 至今

高德地图 · 阿里巴巴集团 · 实习

多模态与视频理解方向

2020.09 - 2024.06

福州大学 · 人工智能 · 学士

本科阶段开始研究生成式视觉与人脸美学