Efficient Video Transformers via Spatial-temporal Token Merging for Action Recognition.
Saved in:
| Title: | Efficient Video Transformers via Spatial-temporal Token Merging for Action Recognition. |
|---|---|
| Authors: | Feng, Zhanzhou1, fengzz@stu.pku.edu.cn, Xu, Jiaming2, 2000012915@stu.pku.edu.cn, Ma, Lei3, lei.ma@pku.edu.cn, Zhang, Shiliang1, slzhang.jdl@pku.edu.cn |
| Source: | ACM Transactions on Multimedia Computing, Communications & Applications; Apr2024, Vol. 20 Issue 4, p1-21, 21p |
| Database: | Applied Science & Technology Source |
| ISSN: | 15516857 |
|---|---|
| DOI: | 10.1145/3633781 |