Efficient Video Transformers via Spatial-temporal Token Merging for Action Recognition.

Saved in:
Bibliographic Details
Title: Efficient Video Transformers via Spatial-temporal Token Merging for Action Recognition.
Authors: Feng, Zhanzhou1, fengzz@stu.pku.edu.cn, Xu, Jiaming2, 2000012915@stu.pku.edu.cn, Ma, Lei3, lei.ma@pku.edu.cn, Zhang, Shiliang1, slzhang.jdl@pku.edu.cn
Source: ACM Transactions on Multimedia Computing, Communications & Applications; Apr2024, Vol. 20 Issue 4, p1-21, 21p
Database: Applied Science & Technology Source
Description
ISSN:15516857
DOI:10.1145/3633781