Research

理解不断展开的世界

我希望构建能在现实时间尺度上持续看见、组织并理解多模态信息的系统。研究从长视频中的事件结构出发,进一步探究生成怎样提出可检验的假设,以及模型怎样在持续到来的视觉流中积累而不遗失证据。

我想让模型在现实时间尺度上形成能够继续修正的理解。下面三段话,说明这条路线为何从长视频出发,又为何走向生成与证据核验。

01

现实中的视觉经验很少被整齐地切成一张张图片。一次实验、一段旅程或一场比赛会持续很久,真正影响判断的线索却只在少数时刻出现。模型需要知道哪里发生了变化,也要记得这些变化前后怎样相连。我的第一条研究线索由此展开。我尝试把视频里的语义边界、事件锚点和查询相关信息组织起来,让有限输入保留足够完整的故事。

02

生成给这条路线补上了另一种可能。模型可以先提出事件描述、缺失状态或未来走向,再回到观测中寻找支持与冲突。这样的生成结果只是一组候选,价值来自它让模糊的内部状态变得可以检查。一个候选若找不到时间位置、视觉实体或前后因果的支持,就应该被修改或舍弃。理解因此有了可操作的中间对象。

03

我最终想做的系统,应当能一边接收持续到来的视频,一边维护对事件的当前理解。它知道哪些内容已经确认,哪些仍是假设,旧证据在什么时候需要重新查看。模型给出的答案只是这一过程的一个出口。更重要的是,答案背后的事件表示能够随着新信息到来继续更新,并保留足够清楚的证据来路。

01

看见

从连续视觉流中找到结构

把视频当作事件沿时间展开,而非彼此孤立的帧。语义边界、事件锚点和长期记忆共同决定模型究竟看见了什么。

EFSWFS-SB
02

生成

把模糊理解变成可检查的候选

让模型生成事件描述、缺失状态或可能的未来,把尚未成形的判断写成能够被定位、比较和否证的中间对象。

Generative understandingHypothesis grounding
03

核验

让理解随着证据继续更新

把候选重新放回时间线和原始视觉证据中检查。保留得到支持的部分,修正冲突之处,并在长时程场景里持续更新事件记忆。

Evidence tracingStreaming video understanding

Ongoing

从选取证据走向生成、核验与持续理解

接下来的工作会把长视频里的事件结构与生成模型连接起来,并让每个候选解释回到观测中接受检查。

A

生成怎样帮助理解

研究生成目标、内部生成特征与候选假设怎样暴露模型尚未理解的部分,再用原始观测定位、核验和修正。

B

长时程流式视频理解

面向持续到来的视频,探索分层记忆、事件更新与证据回看,使模型在低延迟约束下保持长期理解。