行业资讯

加入亿拓客·流量大师 撬动财富之门!!!

"认知启发的视频描述与修正关键技术研究 "项目结题报告

wang 2026-09-24 行业资讯
"认知启发的视频描述与修正关键技术研究 "项目结题报告

国家自然科学基金项目

认知启发的视频描述与修正关键技术研究

基本信息

项目批准号:62006015

申请代码:F0603

项目名称:认知启发的视频描述与修正关键技术研究

项目负责人:许万茹

依托单位:北京交通大学

研究期限:2021-01-01 至 2023-12-31

资助经费:24.0(万元)

中文摘要:

视频描述是实现视频到自然语言转化的桥梁,即用自然语言描述视频内容,视频描述技术有助于实现基于自然语言的视频检索系统以及视觉障碍辅助系统。视频包含丰富复杂的内容和意义,而自然语言具有严格的语法结构和规则,这些都给视频描述任务带来了挑战。因此,本项目受人类认知特点和认知过程的启发,主要研究视频描述和修正问题,生成与修正共同作用,旨在生成准确详细、自然多样的语言描述视频内容。本项目的研究内容主要集中在以下两个方面:1)为了遵循人类认知的主观多样性,克服客观评价标准的不一致性和局部性,本项目拟研究构建一种评价标准无关的视频描述方法,去除评价标准对模型性能的影响;2)为了消除视频描述中的词语错误、语法错误以及语义错误,本项目拟打破“一步到位”的视频描述的传统思想,模拟人类逐步认知的过程,提出并定义视频描述的修正问题,对已有的候选描述进行精炼、校对、润色,达到提高生成视频描述质量的目的。

英文摘要:

Video captioning is a bridge between visual space and natural-language space, namely, describing visual content with natural language text, which can make natural-language based video retrieval available, and assistance system for visual handicapped feasible. Since videos contain complex and rich content and natural languages tend to have strict grammar rules, they both create challenges to video captioning. Therefore, inspired by the cognitive characteristic and cognitive process of humans, this project mainly focuses on video captioning and polishing problem, which aims at generating accurate and diverse sentences to comprehensively describe video content. The main research contents are as follows: 1) Following the subjectivity and diversity of cognitive characteristic to overcome the inconsistency and locality of the objective evaluation criteria, a criteria-free video captioning method will be proposed to reduce the negative effects of evaluation criteria. 2) In order to eliminate the word errors, grammar errors and semantic errors, a novel problem of video caption polishing is proposed and defined to improve the quality of caption sentences. Simulating the gradualism of cognitive process, video caption polishing model gradually refines and corrects the original caption sentences, which breaks the traditional pattern of one-step video captioning.

结题摘要

视频描述是实现视频到自然语言转化的桥梁,即用自然语言描述视频内容。视频包含丰富复杂的内容和意义,而自然语言具有严格的语法结构和规则,这些都给视频描述任务带来了挑战。传统视觉描述中普遍存在的因视觉和自然语言之间的语义鸿沟,造成的生成的描述语句中包含很多错误的问题,以及因标注成对儿数据稀缺,造成的模型不能得到充分训练,域偏移现象严重与不具备自主学习能力的问题。 为克服上述缺陷,提高视频描述性能,本项目重点在 1)视频描述与修正方法研究;2)视频人体行为分析研究;3)跨域半监督视频描述方法研究;4)多任务间知识迁移机制学习研究四方面展开了研究工作。按照指定的研究方案开展了相关工作。1)提出了基于生成-修正框架的两阶段视频描述修正方法和基于深度强化修正网络的视频描述修正方法;2)提出了基于图卷积注意力序列模型的拉班舞谱生成模型和基于双流融合有向图神经网络的连续人体运动识别模型;3)提出了CLIP辅助的跨领域视频描述生成模型和基于LCA增强的半监督视频描述生成模型;4)引入基于元学习的零样本学习思路并提出了基于差分修正网络的零样本学习方法。与此同时,我们在相关数据集上开展了大量实验,实验结果证明了所提方法能够有效修正生成描述中的错误,提高生成描述语句的质量,同时能够有效缓解域偏移现象、增强模型自主学习能力,从而在标注有限的情况下,提升模型的泛化能力。. 在理论层面,本项目取得了相关创新性高水平的研究成果,资助发表 SCI 期刊论文 9 篇和EI会议 2 篇,包括 An1 区 SCI 期刊 2 篇,An2 区 SCI 期刊 4 篇。在投 SCI 期 刊 2 篇,CCF A类会议 1 篇。这些成果可为今后视频描述、视频的高层语义理解领域上更深层次的相关研究提供必要理论积累。在应用层面,作为计算机视觉领域的重要分支之一,本项目可为智能监控和机器人产业提供技术积累,辅助实现服务机器人、智能安防等应用场景,为社会公共安全与民生生活提供保障。

从官网获取报告原文信息请点击左下角“阅读原文”!

版权声明:本文所有文字来自国家自然科学基金委员会官方网站(https://www.nsfc.gov.cn/),版权归原作者/机构所有。如有侵权,请留言并提交证据,收到核实后删。

以科技赋能产业

以创新引领发展

未来,已来!

猜你喜欢

发表评论

发表评论: