參賽序號:1-1
海報主題
3D Reconstruction and Skeleton-Based Action Recognition for Volleyball Matches Using Unity
系級
資工系
指導老師及參賽學生
指導老師:朱威達
參賽學生:方昱晴
構想說明
傳統排球賽事的戰術分析多仰賴固定攝影機所拍攝的二維影片。雖然影片能完整記錄比賽過程,但受到透視投影、球員交疊與球網遮蔽等因素影響,教練與研究人員難以直接從單一視角掌握球員之間的三維相對位置、跑位路徑,以及球員動作與排球軌跡之間的時空關係。為突破二維影像在空間判讀上的限制,本專題建置一套基於 Unity 的排球比賽 3D 重建與骨架動作辨識系統,整合球員骨架、球員移動軌跡與排球軌跡資料,將真實賽事轉換為可由不同視角觀察的虛擬球場,作為賽後重播與戰術分析的基礎。
然而,將電腦視覺推論結果直接轉換為 3D 場景並非單純的座標映射問題。真實比賽影像中普遍存在球員遮蔽、追蹤 ID 切換、關節特徵遺失及不同模型輸出之時空基準不一致等問題。若過度使用插值、ID 修正或逆向運動學補足缺失資訊,雖然能產生視覺上較平順的動畫,卻可能加入原始資料並未提供的假設。因此,本系統以「資料真實性(Data Truthfulness)」與「語意可讀性(Semantic Readability)」之間的平衡作為主要設計原則:在保留原始推論結果與不確定性的前提下,透過必要的資料處理與動作語意推論,提升 3D 重建結果的可理解性。
在後端推論流程中,系統首先針對排球軌跡進行時空事件擷取。使用 Natural Cubic Spline 對離散軌跡進行平滑,並進一步計算其一階與二階變化,透過二階導數突波 |S''(t)| 偵測排球受到外力作用的瞬間,以擷取可能的擊球影格。此方法除了能辨識一般具有明顯高度轉折的球路,也能補捉高度變化不明顯、但加速度產生突變的擊球事件。
取得擊球時間後,系統進入時序動作辨識階段。首先根據排球與球員的三維位置,以跟球策略選取擊球瞬間最接近排球的候選球員,再從其前後時間窗擷取 COCO 17 關節骨架序列。骨架資料經缺幀處理、以骨盆為中心的座標對齊與正規化後,送入 SkateFormer 進行時空骨架特徵推論,辨識接球、舉球與攻擊等排球動作。為降低單純依賴分類模型所造成的錯誤,系統進一步將模型信心度與球員至排球的空間距離共同納入評分,以判斷較合理的擊球者與動作語意。此外,系統依據 3D 動畫本身的動作前搖時間進行 Animation Offset Deduction,使動畫的實際擊球姿態盡可能與偵測到的物理擊球影格同步。
在 Unity 前端重建方面,本專題特別針對真實賽事資料中的高雜訊問題進行架構設計。首先,多目標追蹤在球員交錯與遮蔽時容易產生 ID Switching,使同一名實際球員在不同時間被分配為不同軌跡 ID。與其強制推測不同 ID 是否屬於同一球員,系統採用 Zero-Assumption Instantiation,為資料中實際出現過的軌跡 ID 分別建立模型,並搭配動態能見度控制,只在該 ID 具有有效空間資訊的影格顯示模型。如此可避免錯誤的 ID 合併進一步污染戰術位置資訊,也將追蹤模型的不確定性保留下來供人工判讀。
其次,原始 COCO 17 點骨架中可能存在大量關節缺失。若直接以不完整骨架驅動 3D Avatar 的逆向運動學,容易造成四肢扭曲或模型破圖。因此,本系統採用位移與姿態解耦的 Decoupled Rendering 架構:球員的絕對位置與移動由 3D Avatar 負責呈現,而原始關節資訊則由獨立的 Skeleton Visualizer 疊加繪製。對於已經由 SkateFormer 辨識出具有明確語意的動作事件,再透過 Unity Animator 觸發對應的排球專項動畫。此設計使系統不需將低可信度的殘缺骨架強制轉換成完整人體姿態,同時又能在可信的動作事件中提供較直觀的動作表現。
為進一步提升重建結果的空間可讀性,系統亦實作 Dynamic Proportion Scaling。由於原始資料沒有提供球員真實身高,且單一影格可能受到跳躍、下蹲或救球姿勢影響,因此系統統計球員在單一 Rally 中的垂直位置分布,以固定區間進行 O(N) 直方圖分箱,利用出現頻率較高的高度區間作為比例估計依據,再調整各球員 3D 模型尺寸,以減少所有球員使用統一模型比例所產生的視覺失真。
除了賽事重建,系統亦提供戰術軌跡視覺化功能。透過 Flattened Tactical Point Cloud 與移動軌跡線,將球員歷史位置投影至球場平面,降低三維高度變化與 Z-fighting 對判讀造成的干擾,使使用者能較直觀地觀察特定球員的移動範圍、跑位密度與戰術路徑。原始骨架也可透過 Skeleton Visualizer 保留下來,讓研究人員能在觀看語意動畫的同時,回頭檢查底層骨架推論結果。
實驗結果顯示,本系統能將球員位置、排球軌跡、原始骨架與辨識後的動作事件整合至同一 Unity 3D 場景,並在標準動作情境下,使虛擬球員的擊球姿勢與排球軌跡維持良好的時空對應。對於非標準救球、嚴重遮蔽或骨架特徵不足的情境,系統仍可能產生動作語意或姿態上的誤差,因此目前設計並不隱藏此類不確定性,而是保留原始骨架與軌跡資訊供後續驗證。
未來將朝三個方向持續改進:首先,導入 Multi-view Consensus 或圖神經網路等機制,降低極端遮蔽下高信心度誤判對動作辨識的影響;其次,建立 Global Spatial Calibration,統一不同視覺推論來源的絕對三維座標系;最後,將目前以離線事件預處理為主的架構進一步發展為 Real-time Streaming Pipeline,使 3D 重建由賽後分析逐步延伸至低延遲的排球戰術即時視覺化應用。

