论文辅导网提供毕业论文和发SCI表论文辅导和论文润色服务25年。

人体动作识别怎么做?GCN、Attention与LSTM动作识别算法案例

  • 论文价格:免费
  • 用途: 期刊列表 Managine
  • 作者:上海论文网
  • 点击次数:1
  • 论文字数:10000
  • 论文编号:
  • 日期:2026-09-02
  • 来源:上海论文网

摄像机拍下一段空手道比赛视频,人可以很快判断运动员是在出拳、踢腿还是移动,但让计算机自动完成同样的判断并不简单。尤其当两个动作只有出拳方向、身体重心或某几个关节的位置存在细微差别时,普通的视频分类方法很容易出现误判。本文结合一个Human Action Recognition研究案例,拆解GCN图卷积神经网络、Attention Mechanism、LSTM、人体骨骼关键点以及Delaunay时空拓扑如何配合完成动作识别。除了介绍算法,更重要的是看清楚一篇计算机视觉科研论文怎样从实际问题出发,建立模型、选择Dataset、设计对比实验,并解释为什么某些关节比其他关节更值得模型关注。


期刊论文怎么写


Human Action Recognition,中文通常称为人体动作识别,是Computer Vision中一个非常典型的研究方向。

它要解决的问题看起来很直观:给计算机一段Video,让系统判断人在做什么。

但真正进入实验以后会发现,“识别一个人正在运动”和“准确判断他做的是哪一种动作”完全不是一个难度。

走路、坐下、挥手之间差异比较明显;如果换成拳击、空手道、跆拳道或者其他竞技体育,同类动作之间的区别可能只集中在手臂、腿部、身体方向以及少数关键关节。

识别问题为什么困难常见研究思路
动作相似不同动作只有少数关节存在明显差异Skeleton + Attention
视角变化同一个动作从不同Camera View看差异很大Multi-view Dataset
动作具有时间性单独一帧不能完整描述动作LSTM / Temporal Modeling
人体是非规则结构关节不像普通Image Pixel排列在规则网格中Graph Convolutional Network

一、为什么人体动作识别会用到GCN图卷积神经网络?

理解这篇研究,首先要明白为什么Human Skeleton适合用Graph表示。

传统CNN非常擅长处理Image。因为Image中的Pixel按照规则的二维网格排列,卷积核可以很自然地在上下左右移动。

人体骨骼却不是这样的。

头、肩、肘、手腕、髋、膝、脚踝之间存在天然的连接关系。把人体关键点看成Node,把骨骼连接看成Edge,就可以得到一张Graph。

Human Skeleton → Joint Nodes → Skeleton Edges → Graph Representation → GCN Feature Extraction

例如,判断一个Punch动作时,肩膀、肘部和手腕之间的相对变化非常重要;判断Kick时,髋部、膝盖和脚踝的运动可能更关键。

Graph Convolutional Network,也就是GCN,可以沿着这种人体结构关系传播和提取Feature,因此逐渐成为Skeleton-Based Action Recognition中的重要技术路线。

人体元素Graph中的表示包含的信息
ShoulderNode肩部位置与运动
ElbowNode手臂弯曲与伸展
KneeNode腿部动作变化
Bone ConnectionEdge不同关节之间的结构关系

二、ST-GCN有什么不足?为什么还要重新构建Topology?

经典ST-GCN把人体骨骼表示为Spatial-Temporal Graph,同时考虑关节之间的空间关系以及动作随时间发生的变化。

问题在于,人体解剖学上的直接连接关系,并不一定等于识别某个动作时最有价值的Feature Relationship。

例如两个Joint在人体骨骼结构中可能没有直接相连,但在某种Technical Action中,它们的协同变化却可能非常重要。

本文解析的研究案例因此没有完全沿用简单的Skeleton Connection,而是引入Delaunay Triangulation构建新的Topology,希望获得更丰富的Joint Relationship。

Topology思路特点可能的作用
传统Skeleton Graph主要按照人体骨骼连接结构清晰,但Feature Relationship相对固定
ST-GCNSpatial + Temporal Graph同时描述空间与时间信息
Delaunay Topology重新组织Joint Connection尝试捕获更丰富的动作结构特征

这里其实体现了计算机科研中一个很重要的问题:

不要只问“使用什么模型”,还应该问“输入数据应该怎样表示”。

同样的GCN,如果Graph Construction发生变化,最后能够学习到的信息也可能不同。

三、为什么Attention Mechanism对体育动作识别特别重要?

这是整篇研究最容易理解、同时也很有实际意义的一部分。

如果人在做Kick,腿部Joint通常比手指位置更有判断价值;如果判断左手出拳还是右手出拳,左右手臂相关Joint显然应该得到更多关注。

但普通Skeleton-Based Model如果对所有Joint给予接近的Weight,就可能把大量计算能力放在对当前动作区分意义不大的位置。

Attention Mechanism解决的核心问题就是:

不同动作 → 不同关键关节 → 学习不同Attention Weight → 强化Discriminative Features → 提高Action Recognition能力

原研究特别讨论了Forehand Punch与Backhand Punch这样的相似动作。

两个动作整体Skeleton Pattern很接近,但左右手的Feature Importance不同。Attention如果能够把更多Weight放到真正有区分度的Joint上,就更容易把两个动作分开。

Action更值得关注的JointAttention的意义
PunchShoulder、Elbow、Wrist识别出拳侧与手臂运动
KickHip、Knee、Ankle突出腿部运动特征
Moving躯干与上下肢组合分析整体位移模式

四、GCN已经分析Skeleton了,为什么还需要LSTM?

因为动作不是一张静止图片。

一帧画面可能只看到运动员抬起手臂,但无法判断下一步是Punch、Defense还是其他动作。真正定义Action的,是多个Video Frames之间连续发生的变化。

这也是LSTM在这套架构中的价值。

GCN更擅长学习Skeleton Graph中的Spatial Structural Feature;LSTM则负责进一步建模Temporal Dynamics。

Video → Human Pose / Skeleton → Graph Construction → GCN Spatial Feature → LSTM Temporal Feature → Attention Enhancement → Action Classification

这样理解以后,ASTGC-LSTM这个名字就没有那么复杂了。

它实际上是在回答三个问题:

人体Joint之间怎样连接?动作随时间怎样变化?哪些Joint和Feature更值得关注?

五、实验为什么同时使用通用Dataset和Karate Dataset?

一个Action Recognition模型如果只在自己建立的小数据集上测试,很难判断性能改善究竟来自Model本身,还是Dataset比较特殊。

因此原研究首先使用Kinetics和NTU-RGB+D等通用Action Recognition Dataset进行比较,然后再进入Karate Technical Action Dataset。

Kinetics-600包含约50万个Video,覆盖600种Human Actions,每种动作至少约600个Video,每段约10秒。研究使用OpenPose提取Skeleton Data。

NTU-RGB+D则包含60类Human Actions、56,880个Action Samples,同时包含RGB、Depth Map、3D Skeleton以及Infrared Video等信息。

Dataset规模/特点实验意义
Kinetics-600约500,000 Videos,600类动作验证通用Human Action Recognition能力
NTU-RGB+D60类,56,880 Samples,多模态数据测试Skeleton-Based Recognition
Karate Dataset专业体育动作、动作相似度较高检验Fine-grained Action Recognition能力

这种“General Dataset + Domain-Specific Dataset”的实验思路值得参考。

前者回答模型有没有普遍的识别能力,后者回答它能不能解决论文真正关注的Specialized Problem。

六、1847段空手道视频,真正难在哪里?

原研究建立的Karate Technical Action Dataset来自10名运动员的训练和比赛视频。

数据中包含1847个Video Clips,其中696个Kicking Clips、625个Fist Clips以及526个Moving Clips,每个Video大约持续10秒。

实验使用1786段作为Training Set,另外61段作为Test Set。

类别全部Video ClipsTrainingTest
Kicking69667917
Fist / Punch相关62560817
Moving52649927
Total1847178661

难点并不只是Dataset Size。

通用动作数据中,“站起来”和“梳头”这样的Action在Skeleton Pattern上差异明显;空手道技术动作则可能非常相似。

例如左右手出拳,整体Body Pose接近,真正决定Classification结果的可能只是左右手臂几个关键Joint。

这正好解释了为什么Attention Mechanism在这个实验中非常关键。

七、Top-1从25.2%提高到45.2%,这个结果应该怎么看?

在Karate Technical Action Dataset上,原研究把ASTGC-LSTM与ST-GCN进行了直接比较。

MethodTop-1 AccuracyTop-5 Accuracy
ST-GCN25.2%40.9%
ASTGC-LSTM45.2%68.6%
绝对提升+20.0个百分点+27.7个百分点

这个结果比单纯写“准确率明显提高”更值得分析。

Top-1 Accuracy意味着模型排名第一的Prediction是否正确;Top-5则看正确类别是否出现在概率最高的五个候选中。

ASTGC-LSTM的Top-1达到45.2%,相较ST-GCN的25.2%提高20个百分点;Top-5从40.9%提高到68.6%,增加27.7个百分点。

但这里同样不能写成“动作识别准确率达到68.6%”。68.6%对应的是Top-5 Accuracy,不是Top-1。

另外,45.2%本身也说明Fine-grained Karate Recognition仍然很难。一个好的Results分析不应该只强调提升,还应该承认绝对准确率仍存在继续优化的空间。

八、从这个案例看,AI与计算机视觉科研论文应该怎么组织?

如果把空手道这个具体应用拿掉,这篇研究提供的是一个很典型的Computer Vision科研逻辑:

Practical Problem → Existing Model Limitation → Skeleton Representation → New Graph Topology → Attention Mechanism → Temporal Modeling → General Dataset Validation → Domain Dataset Validation → Baseline Comparison → Result Interpretation

真正值得学习的不是把GCN、LSTM和Attention三个热门词放进标题,而是每个Component都应该对应一个明确的问题。

研究问题对应方法
人体关节是Graph Structured DataGCN
传统Skeleton Topology可能限制Feature RelationshipDelaunay Graph Construction
动作具有Temporal DynamicsLSTM
不同Joint的判别能力不同Attention Mechanism
需要证明改进是否真正有效Dataset + Baseline Comparison

这也是Computer Vision、Artificial Intelligence、Deep Learning等方向评职称期刊论文在整理科研成果时很值得注意的一点。模型复杂并不等于研究逻辑完整,真正需要说明的是为什么修改Topology、为什么加入Attention、Dataset为什么这样选,以及实验结果究竟支持了什么结论。

如果已有自己的实验和数据,在形成科研稿件时,可以进一步从研究问题梳理、模型结构表达、实验设计检查、Results与Discussion组织、英文语言润色以及投稿材料准备等方面完善论文。

FAQ:人体动作识别与GCN常见问题

1. Human Action Recognition是什么?
Human Action Recognition即人体动作识别,目标是利用Video、Skeleton、Pose或其他视觉信息自动判断人体正在执行的动作。

2. 为什么人体骨骼适合使用GCN?
人体Joint天然具有Graph Structure。关节可以表示成Node,骨骼及其他Joint Relationship表示成Edge,因此GCN能够比较自然地学习Skeleton Feature。

3. ST-GCN是什么意思?
ST-GCN通常指Spatial Temporal Graph Convolutional Network,它同时考虑人体关节的Spatial Relationship和Action Sequence中的Temporal Information。

4. LSTM在动作识别中有什么作用?
动作由连续Video Frames组成,LSTM可以进一步学习Sequence中的Temporal Dynamics,而不是只分析某一帧的静态Pose。

5. Attention Mechanism为什么能够提高动作识别能力?
不同动作依赖的关键Joint不同。Attention能够让Model对具有较强Discriminative Ability的Feature给予更高Weight。

6. Delaunay Triangulation为什么可以用于Skeleton Graph?
在这个研究案例中,它用于重新构建Joint之间的Topology,希望突破只按照传统骨骼直接连接建立Graph的限制,捕获更多相关Joint Feature。

7. Top-1 Accuracy和Top-5 Accuracy有什么区别?
Top-1要求概率最高的Prediction就是正确类别;Top-5则只要求正确类别出现在概率最高的五个Candidate中,因此Top-5通常明显高于Top-1。

8. 为什么专业体育动作比普通人体动作更难识别?
很多专业动作整体Pose十分接近,区别可能集中在少量Joint、运动方向和时间顺序上,因此属于更细粒度的Action Recognition问题。

9. 体育动作识别只能用于空手道吗?
不是。类似的Skeleton、Pose Estimation、GCN和Temporal Modeling思路还可以扩展到健身动作分析、球类运动、武术、康复训练以及Human Behavior Analysis等场景。

10. 计算机方向科研论文怎样避免只堆模型?
每个Model Component都应该对应明确Research Problem,并通过Baseline、Ablation、不同Dataset或其他实验说明新增模块到底解决了什么问题。

总结:动作识别真正要学习的是“哪些关节在什么时候最重要”

人体动作识别并不是简单地把一段Video交给Deep Learning Model就结束了。

这个研究案例把人体Skeleton看成Graph,通过Delaunay方法重新组织Topology,用GCN提取Spatial Structural Feature,再利用LSTM描述动作随时间发生的变化,并通过Attention Mechanism提高关键Joint的Feature Weight。

在Karate Technical Action Dataset中,ASTGC-LSTM的Top-1 Accuracy由ST-GCN的25.2%提高到45.2%,Top-5由40.9%提高到68.6%。这些结果说明新的Topology和Attention设计在该实验条件下带来了明显改善,同时45.2%的Top-1结果也提醒我们:面对高度相似的专业体育动作,Fine-grained Action Recognition依然具有很大的研究空间。

从科研写作角度看,最值得借鉴的是一条完整的证据链:先找到Existing Method在Specific Scenario中的问题,再提出有针对性的Model Modification,最后通过General Dataset和Domain Dataset验证这种改变到底有没有意义。

技术案例来源与说明:
本文为Human Action Recognition、Graph Convolutional Network与体育视频智能分析技术案例解析。涉及ASTGC-LSTM、Delaunay Topology、Attention Mechanism、Kinetics、NTU-RGB+D、Karate Technical Action Dataset以及相关实验结果的内容,依据公开发表研究《An Attention Enhanced Spatial–Temporal Graph Convolutional LSTM Network for Action Recognition in Karate》,Applied Sciences, 2021, 11(18), 8641进行整理。本文重点解释其算法逻辑、实验设计及科研论文研究方法,并非将相关模型、实验数据或研究成果声明为本站原创。


微信二维码
微信二维码
1,点击按钮复制下方QQ号!!
2,打开QQ >> 添加好友/群
3,粘贴QQ,完成添加!!