ç®æ¬¡ ç®æ¬¡ ã¯ããã« ECCV2022ã®ãã©ããã³ã°è«æ ããã¯ã¢ããããè«æ Towards Grand Unification of Object Tracking Tracking Objects As Pixel-Wise Distributions Particle Video Revisited: Tracking through Occlusions Using Point Trajectories XMem: Long-Term Video Object Segmentation with an Atkinson-Shiffrin Memory Model æåŸã« ã¯ããã« ãã®èšäºã¯ååã®èšäºã®åŸç·šã§ããECCV2022ã§ç޹ä»ããããã©ããã³ã°ã«é¢ããè«æãããã€ãã玹ä»ããŸãã engineers.ntt.com ECCV2022ã®ãã©ããã³ã°è«æ 1645æ¬ã®è«æã®äžã§"tracking"ã"tracker"ãšããåèªãã¿ã€ãã«ã«å«ãŸããŠãããã®ã¯ã以äžã®è¡šã«ç€ºããéã30ä»¶ãããŸããã ããã«éãããVideo Segmentationãªã©ã®æèã§ç©äœè¿œè·¡ããããªã£ãŠããè«æãããããã§ããã 2次å
ç©äœè¿œè·¡ è«æã¿ã€ãã« ãªã³ã¯ âïž Towards Grand Unification of Object Tracking abst GitHub âïž Tracking Objects as Pixel-wise Distributions abst GitHub âïž Particle Video Revisited: Tracking Through Occlusions Using Point Trajectories abst GitHub âïž XMem: Long-Term Video Object Segmentation with an Atkinson-Shiffrin Memory Model abst GitHub AiATrack: Attention in Attention for Transformer Visual Tracking abst GitHub Joint Feature Learning and Relation Modeling for Tracking: A One-Stream Framework abst GitHub Backbone is All Your Need: A Simplified Architecture for Visual Object Tracking abst GitHub Hierarchical Feature Embedding for Visual Tracking abst GitHub MOTR: End-to-End Multiple-Object Tracking with TRansformer abst GitHub Tracking Every Thing in the Wild abst Bayesian Tracking of Video Graphs Using Joint Kalman Smoothing and Registration abst ByteTrack: Multi-Object Tracking by Associating Every Detection Box abst GitHub Robust Multi-Object Tracking by Marginal Inference abst Towards Sequence-Level Training for Visual Tracking abst GitHub Tracking by Associating Clips abst Graph Neural Network for Cell Tracking in Microscopy Videos abst GitHub Robust Visual Tracking by Segmentation abst GitHub FEAR: Fast, Efficient, Accurate and Robust Visual Tracker abst GitHub HVC-Net: Unifying Homography, Visibility, and Confidence Learning for Planar Object Tracking abst Robust Landmark-based Stent Tracking in X-ray Fluoroscopy abst 3次å
ç©äœè¿œè·¡ è«æã¿ã€ãã« ãªã³ã¯ CMT: Context-Matching-Guided Transformer for 3D Tracking in Point Clouds abst Towards Generic 3D Tracking in RGBD Videos: Benchmark and Baseline abst GitHub SpOT: Spatiotemporal Modeling for 3D Object Tracking abst 3D Siamese Transformer Network for Single Object Tracking on Point Clouds abst GitHub Large-displacement 3D Object Tracking with Hybrid Non-local Optimization abst GitHub PolarMOT: How far can geometric relations take us in 3D multi-object tracking? abst project ãã®ä» è«æã¿ã€ãã« ãªã³ã¯ æŠèŠ MOTCOM: The Multi-Object Tracking Dataset Complexity Metric link project ããŒã¿ã»ããã®é£æåºŠè©äŸ¡ The Fish Counting Dataset: A Benchmark for Multiple Object Tracking and Counting link GitHub æ°ããããŒã¿ã»ããã®ææ¡ Large scale Real-world Multi Person Tracking link GitHub æ°ããããŒã¿ã»ããã®ææ¡ BodySLAM: Joint Camera Localisation, Mapping, and Human Motion Tracking link video ç»åãã人ç©ã®å§¿å¢ã3Dã¡ãã·ã¥ãªã©ãæšå® AvatarPoser: Articulated Full-Body Pose Tracking from Sparse Motion Sensing link GitHub äœã«ã€ããå°æ°ã®VRãã©ãã«ããå
šèº«ã®å§¿å¢ãæšå® ããã¯ã¢ããããè«æ 以äžã§ã¯ããªã¹ãã¢ããããäžã§ç§ãã¡ãç¹ã«èå³ãæã£ã4ã€ã®è«æã«ã€ããŠè©³çްã«èŠãŠãããŸãã Towards Grand Unification of Object Tracking æŠèŠ ã·ã³ã°ã«ã«ã¡ã©ã®ãã©ããã³ã°ã«ã¯äŒŒãŠéãªã以äžã®4ã€ã®ã¿ã¹ã¯ããããŸããæ¬è«æã§ã¯ãããã®ãããã«ãé©çšå¯èœãªã¢ãã«ãææ¡ãããŠããŸãã Single Object Tracking (SOT) åç»ã®åé ã«ãŠãŒã¶ãŒãããŠã³ãã£ã³ã°ããã¯ã¹ã§æå®ããåäžã®ç©äœã远跡ããã¿ã¹ã¯ãã«ããŽãªã®æå®ãç¡ãåæåž«çãªæšè«ãå¿
èŠãšããã ãµãŒãã€è«æ: Single Object Tracking: A Survey of Methods, Datasets, and Evaluation Metrics é¢é£ããŒã¿ã»ãã: TrackingNet 1 , LaSOT 2 Multiple Object Tracking (MOT) ç¹å®ã®ã«ããŽãªã«å±ããè€æ°ã®ç©äœãããŠã³ãã£ã³ã°ããã¯ã¹ã§è¿œè·¡ããã¿ã¹ã¯ãè»äž¡ã®ãã©ããã³ã°ãªã©ãåãã«ããŽãªã§äŒŒéã£ãç©äœãæ··åããã«è¿œè·¡ããå¿
èŠãããã é¢é£ããŒã¿ã»ãã: MOT17 3 , BDD100K 4 Video Object Segmentation (VOS) åç»ã®åé ã«ãŠãŒã¶ãŒãã»ã°ã¡ã³ããŒã·ã§ã³ãã¹ã¯ã§æå®ããç©äœã远跡ããã¿ã¹ã¯ã é¢é£ããŒã¿ã»ãã: DAVIS(Densely Annotated Video Segmentation)-2016 & DAVIS-2017 5 Multi Object Tracking and Segmentation (MOTS) ç¹å®ã®ã«ããŽãªã«å±ããè€æ°ã®ç©äœãã»ã°ã¡ã³ããŒã·ã§ã³ãã¹ã¯ã§è¿œè·¡ããã¿ã¹ã¯ã é¢é£ããŒã¿ã»ãã: MOTS20 Challenge 6 , BDD100K MOTS Challenge ç ç©¶ã®ã¢ãããŒã·ã§ã³ èè
ã®å顿èãšããŠä»¥äžã®2ç¹ãæããããŠããŸãã çŸç¶ææ°ã®ææ³ã¯ç¹å®ã®ã¿ã¹ã¯ã«ç¹åããããŠæ±çšæ§ã«æ¬ ããŠãã ç¬ç«ããŠã¢ãã«èšèšãããŠããããããã©ã¡ãŒã¿ãŒãåé·åããŠãã äžèšã®ã¿ã¹ã¯ãåäžã®ãããã¯ãŒã¯ã§è§£ãããšã«ããããããã解決ããããšããŠããŸãã é¢é£ç ç©¶ 以äžã®ããã«SOTãšVOTãåæã«è§£ããææ³ããMOTãšMOTSãåæã«è§£ããææ³ãªã©ããããŸã§ææ¡ãããŠããŸãããã4ã€ã®ã¿ã¹ã¯ãå
šãŠåæã«è§£ãææ³ã¯æ¬è«æãåããŠã ãšäž»åŒµããŠããŸãã SOTãšVOTãåäžãããã¯ãŒã¯ã§è§£ããç ç©¶ D3S-a discriminative single shot segmentation tracker 7 , In CVPR2020 Siam R-CNN: Visual Tracking by Re-Detection 8 , In CVPR2020 MOTãšMOTSãåäžã®ãããã¯ãŒã¯ã§è§£ããç ç©¶ TrackFormer: Multiobject tracking with transformers 9 , In CVPR2021 Track to detect and segment: An online multi-object tracker 10 , In CVPR2021 ææ¡ææ³ 以äžã®å³ã«ç€ºãããããã¯ãŒã¯ã¯Unicornãšåä»ããããŠããŸãããŸãåãã«ãReference FrameãšCurrent Frameã®äž¡æ¹ãè§£å床ãã®ãŸãŸã§FPN(Feature Pyramid Network)ã«å
¥åããæ¬¡ã«èª¬æããUnified EmbeddingãUnified Headã«æž¡ããŸãã Unified Embedding ãã®ã³ã³ããŒãã³ãã§ã¯ç¹åŸŽããããããã¬ãŒã éããã¯ã»ã«ã¬ãã«ã§å¯Ÿå¿ä»ããŸãã ãŸãå³äžã®I(Interaction)ã®éšåã§ã¯Vision Transformer (ViT)ãçšããããšã§ãã¿ã€ã ã¹ã¿ã³ããé¢ããŠããReference FrameãšCurrent Frameã«å¯ŸããŠæ£ç¢ºãªå¯Ÿå¿é¢ä¿ãæœåºããŸããåãªãViTã§ã¯èšç®éãå¢ããŠããŸãã®ã§ãDeformable Attention TransformerãšåŒã°ããAttentionç¯å²ãèªç±ã«å€åœ¢ããªããå¹çããéèŠãªé åãåç
§ããã¢ãã«ã䜿ã£ãŠããŸãã Unified Head äžã§åŸããã察å¿é¢ä¿ã¯ã¿ã¹ã¯ã«ãã£ãŠç°ãªã掻çšããªãããŸãã SOTãšVOSã§ã¯å³äžã®P(Propagation)ã®éšåã§ããŠãŒã¶ãŒãReference Frameã«äžããã»ã°ã¡ã³ããŒã·ã§ã³ãã¹ã¯ããïŒããŠã³ãã£ã³ã°ããã¯ã¹ãäžããããå Žåã¯åè§ããã¹ã¯ãšã¿ãªãåæ§ã«åŠçããŸãïŒãèšç®ãããã¯ã»ã«ã®å¯Ÿå¿é¢ä¿ã«åºã¥ããŠãCurrent Frameã«ãããŠç©äœã®ãããããªäœçœ®ã®äºåååžãèšç®ããŸãããã®äºåååžã¯ç©äœæ€åºã¢ãžã¥ãŒã«ã§ããUnified Headã®çŽåã«é©çšãããç»åã®æ³šç®ãã¹ãç®æã瀺ããŠããŸãã äžæ¹ãMOTãšMOTSã§ã¯ç©äœæ€åºåŸã®å³äžã®A(Association)ã®éšåã§ããã¯ã»ã«ã¬ãã«ã®å¯Ÿå¿é¢ä¿ãããšã«ã€ã³ã¹ã¿ã³ã¹ã¬ãã«ã§ã®ãªããžã§ã¯ãå士ã®çŽä»ããè¡ãã远跡äžã®ã¿ãŒã²ãããšCurrent Frameããæ€åºããç©äœã®å¯Ÿå¿ã¥ããè¡ããŸãã ãã®ããã«ã²ãšã€ã®åºåã4ã€ã®ã¿ã¹ã¯ããããã«æµçšã§ããããšããã®ææ³ã®ç¹é·ã§ãã åŠç¿æ¹æ³ å
šäœã®åŠç¿æ¹æ³ã¯SOT-MOTåååŠç¿ãšVOS-MOTSåååŠç¿ã®2ã€ã®æ®µéã§è¡ãããŸããåãã«SOT-MOTåååŠç¿ã§ã¯ãSOTãšMOTã®ããŒã¿ã»ãããããšã³ãããŒãšã³ãã«Unified Embeddingã®ãã¯ã»ã«ã¬ãã«ã®å¯Ÿå¿æå€±ãšUnified Headã®æ€åºæå€±ãçšããŠãããã¯ãŒã¯ãæé©åããŸããæ¬¡ã®VOS-MOTSåååŠç¿ã§ã¯ããã¹ã¯ãã©ã³ã 11 , 12 ã远å ããŠä»ã®ãã©ã¡ãŒã¿ãåºå®ããŠVOSãšMOTSã®ããŒã¿ã»ãããçšããŠãã¹ã¯æå€±ãæé©åããããšã§åŠç¿ããŸãã å®éšçµæ åŠç¿ã«ã¯16å°ã®NVIDIA Tesla A100ã§åããŠããŸããè«æã«ã¯æžãããŠããŸããã§ããããæšè«ãããããåŠç¿æãšåãç°å¢ã䜿ã£ãŠãããšæãããŸãã åã¿ã¹ã¯ããããã«ã€ããŠå°éçã«åŠç¿ããã¢ãã«ãšåçšåºŠã®æ§èœãæã¡ãA100ã§å
¥åè§£å床640x1024ã«å¯Ÿã20FPSãšãããªã¢ã«ã¿ã€ã æšè«ãéæããŠããŸãã ææ³ æ¬æ¥4ã€ã®ã¢ãã«ãå¿
èŠã§ãããšããã1ã€ã®ã¢ãã«ã§å®çµãããããšãã§ãããã¬ãŒãã³ã°ã³ã¹ãã®é¢ã§ãæšè«ã³ã¹ãã®é¢ã§ãæçšã ãšèšããŸãããŸããç°ãªãã¿ã¹ã¯ãåäžã®ã¢ãã«ã«è§£ãããããšã§ãæ±åæ§èœã®é«ãã¢ãã«ãç²åŸã§ããŠããã®ã§ã¯ãªãããšãæããŸããã Tracking Objects As Pixel-Wise Distributions æŠèŠ ãã®è«æã§ã¯ãMulti-object tracking (MOT)ã«ãããŠããŠã³ãã£ã³ã°ããã¯ã¹ãäžå¿ç¹ã«ããåŸæ¥ã®ãã©ããã³ã°ææ³ãšç°ãªãããªããžã§ã¯ãäœçœ®ã®ååžããã¯ã»ã«åäœã«æšå®ããŠãã©ããã³ã°ããææ³P3AFormerãææ¡ããŠããŸãããã¯ã»ã«åäœã«æšå®ããããšã§å°ããªãªããžã§ã¯ãã«ãªã¯ã«ãŒãžã§ã³ãçºçããå Žåãæ£ãããã©ããã³ã°ããããšãå¯èœã«ãªããŸãã ææ¡ææ³ æ¬¡ã®å³ã¯ãææ¡ææ³ã®ãªããžã§ã¯ãäœçœ®ã®ååžããã¯ã»ã«åäœã§äºæž¬ããæ¹æ³ã瀺ããŠããŸãããŸããResNetãSwin-Transformer 13 ãªã©ã®Backboneãçšãããç»åç¹åŸŽãæœåºããŸããããããPixel Decoderã«ã¯DETR 14 ã®decoderãçšããããã¢ãããµã³ããªã³ã°ãé©çšããããšã§ãã¯ã»ã«åäœã®è¡šçŸãçæããŸããæ¬¡ã«ããããŒéã®ç¹åŸŽããŸãšããããã«FlowNet 15 , 16 ãçšããŠåãã¬ãŒã ãããã¯ã»ã«åäœã®ç¹åŸŽäŒæ¬(Pixel-wise Propagation)ãè¡ããŸããæçµçã«Transformer DecoderãçšããŠãã¯ã»ã«åäœã®ãªããžã§ã¯ãäœçœ®ã®ååžãäºæž¬ããŸãã æ¬¡ã®å³ã¯ããã¯ã»ã«åäœã§æšå®ããããªããžã§ã¯ãäœçœ®ã®ååžãçšããŠãã¬ãŒã ããšã®é¢é£ä»ããè¡ãæŠèŠã§ããåºæ¬çãªæ çµã¿ã¯ã«ã«ãã³ãã£ã«ã¿ãŒ 17 ãšãã³ã¬ãªã¢ã³ã¢ã«ãŽãªãºã ãå©çšããäžè¬çãªæ¹æ³ãšåæ§ã§ãããã³ã¬ãªã¢ã³ã¢ã«ãŽãªãºã ã®ã³ã¹ã颿°ã¯åŒ(6)ã®ããã«å®çŸ©ãããŠããŸããåŒ(6)ã®å³èŸºæ¬åŒ§å
ãããããŸã§ã®æå»ã§è¿œè·¡ããããªããžã§ã¯ã ãšæå» ã§æ€åºãããåè£ãªããžã§ã¯ãiã«å®çŸ©ãããã³ã¹ãã§ãã ã¯äºæž¬ã¯ã©ã¹ã®ã¯ãã¹ãšã³ããããŒèª€å·®ã§ãã ã¯ãã¯ã»ã«ã®ããŒããããã衚ããŠãããçã®ããŒãããã ã¯ãªããžã§ã¯ãäžå¿ã«äœçœ®ããããã«èšå®ãããã¬ãŠã¹é¢æ°ãçšããããŸããã¬ãŠã¹é¢æ°ã®ååŸã¯ãªããžã§ã¯ãã®å€§ããã«æ¯äŸããããã«èšå®ãããŸããã€ãŸãåŒ(6)ã¯ãæ¢ã«è¿œè·¡ããããªããžã§ã¯ãéåãšæå» ã§æ°ãã«æ€åºãããåè£ãªããžã§ã¯ãéåã®ç·åœãããã¢ã®ãã¡ãäºæž¬ãããã¯ã©ã¹ã©ãã«ãæ£ãããã€ããŒããããã®éãªãã倧ãããã®ãåäžç©äœãšããŠå¯Ÿå¿ä»ããããããèšèšããã颿°ã§ãããšèšããŸãã å®éšçµæ 次ã®å³ã¯(a)MOTR 18 , (b)TransCenter 19 , (c)ææ¡ææ³ã®P3AFormerã®ãã©ããã³ã°çµæã瀺ããŠããŸããç»åå³äžã«å°ãã衚瀺ãããŠãã人ç©ã«æ³šç®ããŠãã ããã(a)ã¯å°ããªäººç©ã®æ€åºã«å€±æããŠããŸãã(b)ã¯éæ ã§ç€ºããŠããããã«ãªã¯ã«ãŒãžã§ã³ãçºçããå ŽåIDã誀ã£ãŠå²ãåœãŠãããŸããããã«å¯ŸããŠ(c)ã®ææ¡ææ³ã¯ãã¯ã»ã«åäœã®ãªããžã§ã¯ãäœçœ®ã®æšå®ã«ãããªã¯ã«ãŒãžã§ã³äžã«ãããŠãå°ããªäººç©ãé å¥ã«ãã©ããã³ã°ããŠããããšãåãããŸãã æ¬¡ã®å³ã¯P3AFormerã®ãã¯ã»ã«åäœã§æšå®ããäžå¿ããŒãããããšãã©ããã³ã°çµæãå¯èŠåããŠããŸãããªããžã§ã¯ãã®äžå¿ã¯å
šè²ã倧ããé ããå Žåã§ãæ£ããæšå®ã§ããŠãããçµæãšããŠé ãã«é å¥ãªè¿œè·¡ã«ã€ãªãã£ãŠããããšãåãããŸãã ææ³ ãã©ããã³ã°ã«ãã¯ã»ã«åäœã®æšå®ãçšããããšã§ãªã¯ã«ãŒãžã§ã³ãé å¥ã«ãªãæ§èœãåäžãããŠããç¹ãé¢çœãã£ãã§ãã Particle Video Revisited: Tracking through Occlusions Using Point Trajectories æŠèŠ ä»»æã®ãã¯ã»ã«ãã¿ãŒã²ãããšããŠãã©ããã³ã°ãè¡ãè«æã§ãããã®ææ³ãããŒã¹ã«ããŠãŒã¶ãŒã«æå®ãããã»ã°ã¡ã³ããŒã·ã§ã³ãã¹ã¯ã®ããããã®ãã¯ã»ã«ã远跡ããããšã§VOTã¿ã¹ã¯ãè§£ãããšãã§ããŸããåãããã¯ã»ã«ã¬ãã«ã®å¯ãªãã©ããã³ã°ãå¯èœãªoptical flowããããªã¯ã«ãŒãžã§ã³ã«åŒ·ããé·ããã¬ãŒã ã«ããã£ãŠå¯Ÿè±¡ã远跡ã§ãããšããç¹é·ããããŸãã èæ¯ ã¢ãŒã·ã§ã³æšå®ã®ã¢ãããŒãã¯2éãã«åããããŸãã feature matchingã§ç¹åŸŽç¹ã®å¯Ÿå¿ããšã é¢ãããã¬ãŒã éã§ã察å¿å¯èœ æšå®ãçã§ãããçã£ããã¯ã»ã«ã®ãã©ããã³ã°ãã§ããªã optical flowã§åãã¯ã»ã«ã®ã¢ãŒã·ã§ã³ãã¯ãã«ãåŸã optical flowã®èšç®ãç¹°ãè¿ãã°çã£ããã¯ã»ã«ããã©ããã³ã°ã§ãã ãããŸã§å±æçãªãã¯ã»ã«ã®å€åãã远ããªã è¿œè·¡å¯Ÿè±¡ã®æåãäœããéãéããæãæåã®ç©ã«ãã©ãã«ãŒãç§»ããªã©ããŠç Žç¶»ãã 远跡äžã®ãã¯ã»ã«ãå°ããã€ãããŠãã ãããŠãã®2ã€ã®ã¢ãããŒãã®äžéããšã£ã2006幎ã®particle video 20 ã§ã¯ãç»é¢å
šäœã«ãã©ãã«ãŒãé
眮ããã¬ãŒã ããšã«ãäºãã®äœçœ®é¢ä¿ã調æŽãããããšã§ãfeature matchingãããå¯ã§optical flowãããé·æéå®å®ããã¢ãŒã·ã§ã³æšå®ãå¯èœã«ãªããŸããã ããããã®ææ³ã¯äŸç¶ãšããŠãªã¯ã«ãŒãžã§ã³ã«å¯Ÿå¿ããããŠãããã远跡察象ãé ããããšã¯æ€ç¥ã§ãããã®ã®ãã®ãŸãŸèŠå€±ã£ãŠããŸããšããåé¡ããããŸããã æ¬è«æã§ã¯ããããã£ãŒãã©ãŒãã³ã°ããŒã¹ã«æ¡åŒµããä»»æã®ãã¯ã»ã«ãç¬ç«ã«è¿œè·¡ã§ãããããäžæçãªãªã¯ã«ãŒãžã§ã³ãªãå远跡ãã§ããããã«ãªã£ãŠããŸãã ææ¡ææ³ ãã¬ãŒã ã®é£ç¶ç»åãšããã©ããã³ã°ãããç¹ïŒãã©ãã«ãŒãšåŒã³ãŸãïŒã®åæåº§æšãå
¥åãšããŠãåãã¬ãŒã ã«ããããã©ãã«ãŒã®åº§æšãšããã©ãã«ãŒãé ããŠãããã©ããã瀺ããªã¯ã«ãŒãžã§ã³ãã©ã°ãæšå®ããŸããåççã«ã¯è¿œè·¡å¯Ÿè±¡ãé ããŠã ãã¬ãŒã 以å
ã«ãŸãçŸããã°èŠã€ãåºããããšãæåŸ
ã§ããŸãã å
šäœèšèšã¯optical flowæšå®åšã®RAFT 21 ã«äŒŒãŠãããæŽæ°é¢æ°ãç¹°ãè¿ãé©çšããŠæ¬¡ã®ãã¬ãŒã ã®äºæž¬å€ãåæããããšããæ¹æ³ããšã£ãŠããŸãã ãŸãRAFTãšåããããã¯ãŒã¯ãå©çšããåãã¬ãŒã ç¬ç«ã«ç¹åŸŽããã(feats)ãäœæããŸãã æ¬¡ã«åæãã¬ãŒã ã§ã®åº§æš ãšãã®äœçœ®ã®ç¹åŸŽ ãçšæãã ãã¬ãŒã ã«ãããäºæž¬å€ãå
šãŠãããã«åæåããŸãïŒ ïŒãããã¯ã¡ããã©ãã©ãã«ãŒã ãã¬ãŒã ã®éå
šãåããŠããªããšä»®å®ããŠããããšã«ãªããŸãã ãããŠIterative inferenceã§å²ãããŠããåŠçã«ãã£ãŠåæå»ã«ããããã©ãã«ãŒã®åº§æš , ç¹åŸŽ , ãªã¯ã«ãŒãžã§ã³ãã©ã° ãå°ããã€æé©åãããŠããã åã®ã€ãã¬ãŒã·ã§ã³ã®åŸã«åŸãããäºæž¬å€ ãæçµçãªäºæž¬ãšããŸãã Iterative inferenceã§ã¯ã€ãã¬ãŒã·ã§ã³ããšã«æ¬¡ã®ãããªæäœãè¡ãããŸããåãã«ãçŸç¶ã®ãã©ãã«ãŒã®æšå®ç¹åŸŽ ãšç¹åŸŽãããfeatsãšã®dot productããšãããã©ãã«ãŒãšå
¥åç»åãšã®é¡äŒŒåºŠããããçæããŸããæ¬¡ã«ãé¡äŒŒåºŠããããããã©ãã«ãŒã®æšå®äœçœ® ã®åšã ã®ç¯å²ãåãåºããŸãããã®æåãåºãè§£å床㯠皮é¡çšæããŠããã1ã€ã®ãã©ãã«ãŒã«å¯Ÿã㊠ã®shapeãæã€ãã³ãœã«ãæã«å
¥ããŸãã ãããŠããã€ãŒããªææ³ãèãããªããã®äžã§æå€§å€ãåãïŒã€ãŸãæãé¡äŒŒåºŠã®é«ãïŒç¹ãäžçªãã£ãšãããããã©ãã«ãŒäœçœ®ã ãšèšããŸãããæ¬ææ³ã§ã¯MLP MixerãšåŒã°ãããã¥ãŒã©ã«ããããçšããŠãã©ãã«ãŒã®äœçœ® , ç¹åŸŽ , ãªã¯ã«ãŒãžã§ã³ãã©ã° ãæšå®ããŸãã以äžã®æäœãç¹°ãè¿ãããšã§äºæž¬ãå°ããã€æé©åããŠãããŸãã ãã¬ãŒã ã®æšè«ãçµããåŸã次㮠ãã¬ãŒã ãå
¥åã远跡ãç¶ããããšã«ãªããŸãããããåã«æåŸã®äºæž¬å€ ãæ¬¡ã®åæå€ã«ãããšãèŠãç®ã®äžæçãªå€åïŒããªãã¡ç¹åŸŽéã®å€åïŒã®ããã§ãã©ãã«ãŒãããããšããåé¡ãããã®æå¯Ÿè±¡ãé ããŠããå ŽåèŠå€±ã£ãŠããŸããšããåé¡ããããŸããããã§ããªã¯ã«ãŒãžã§ã³ãã©ã°ãåç
§ãäžçªããèŠããŠããæå» ã®åº§æšãšãåæå€ã® ãçšããŠå远跡ãè¡ããŸãã ã㢠以äžã®ãã¢åç»ã§ã¯éЬã®ãããšã远跡ãããŠãããææ¡ææ³ã§ã¯è¶³ãæåã®æ±ã«é ããŠãèŠå€±ã£ãŠããªãããšãããããŸãã https://particle-video-revisited.github.io/videos/horse_all.mp4 particle-video-revisited.github.io ææ³ ç©äœã®ã«ããŽãªã«ããããã¯ã»ã«ã¬ãã«ã§è¿œè·¡ãã§ãããšããã®ã¯é
åçã«æããŸãããç©äœæ€åºã¿ã¹ã¯ãªã©ã«ãããã¢ãããŒã·ã§ã³æ¯æŽã«ã䜿ãããã§ãã XMem: Long-Term Video Object Segmentation with an Atkinson-Shiffrin Memory Model æŠèŠ ãã®è«æã¯ã1968å¹Žã«æå±ãããAtkinsonâShiffrin memory model 22 ãšããæèŠèšæ¶ãäœæ¥èšæ¶ãé·æèšæ¶ã®3ã€ãããªãèšæ¶ã¢ãã«ã«è§Šçºãããé·æéæ åçšã®VOSææ³XMemãææ¡ããŠããŸãã ãã®ææ³ã®ç¹é·ã¯GPUã¡ã¢ãªã®æ¶è²»ãå°ãªãç¹ãšé·æéã®æ åã«ã察å¿ã§ããç¹ã§ããæ¬¡ã®å³ã¯ãçæéã®æ åããŒã¿ã»ããDAVISãšãåèš7000ãã¬ãŒã 以äžã®3ã€ã®ãããªãå«ãé·æéã®æ åããŒã¿ã»ããLong-time Video dataset 23 ãçšããå®éšçµæã§ããå·Šã®ã°ã©ãã§ã¯ã¢ãã«ã䜿çšããGPUã¡ã¢ãªãšVOSæ§èœã®é¢ä¿ãå³ã§ã¯å
¥åæ åé·ãå€åããããšãã®æ§èœã®å€åã瀺ãããŠããŸããå·Šãããææ¡ã¢ãã«ã¯æ¢åã¢ãã«ãããã¡ã¢ãªäœ¿çšéãå°ãªãã«ãé¢ãããé«ãæ§èœã§ããããšãåãããŸãããŸãå³ãããæ¢åææ³ã¯å
¥åæ åé·ãé·ããªããšæ§èœãå£åããäžæ¹ã§ãææ¡ææ³ã®æ§èœã¯å£åããã©ããããããåäžããŠããããšãåãããŸããSTM 24 , AOT 25 , STCN 26 ã®ããã«ç¹åŸŽã¡ã¢ãªãæ¥æ¿ã«å¢å ããæ¢åææ³ã§ã¯ãã¡ã¢ãªã«ä¿åããé »åºŠãèœãšããŠäœ¿çšããããããé·æéå
¥åã«å¯ŸããŠå®å®ããæ§èœãçºæ®ã§ããŠããŸããã æ¬¡ã®å³ã¯STCNãšXMemã®ã¹ã±ãŒãªã³ã°æåã詳现ã«ç€ºããŠããŸããæšªè»žããã¬ãŒã æ°ã§ã瞊軞ã粟床ã§ãããã¬ãŒã ãå¢å ãããšSTCNã¯æèã®æ¬ èœã«ããæ§èœãäœäžããããXMemã¯ååãªæèãä¿æãå®å®ããŠããããšãåãããŸãã ææ¡ææ³ æ¬¡ã®å³ã¯XMemã®å
šäœåã瀺ããŠããŸãããã®ææ³ã¯AtkinsonâShiffrin memory modelãšåæ§ã«Sensory memory, Working memory, Long-term memoryã®3ã€ã®ã¡ã¢ãªã¹ãã¢ããæ§æãããŠããŸããSensory memoryã¯æ¯ãã¬ãŒã æŽæ°ãããéåžžã«å±æçãªæéã®ç¹åŸŽãä¿åããŸããWorking memory㯠æããšã«æ
å ±ãèç©ããäºåã«èšå®ãããæå€§ä¿æãã¬ãŒã ãè¶
ãããšæ
å ±ãå§çž®ããäžã§Long-term memoryã«ç§»è¡ããŸããLong-term memoryã¯äºåã«èšå®ããæå€§ãã¬ãŒã æ°ïŒãããæ°åãã¬ãŒã ïŒãè¶
ãããšç¹åŸŽãå¿ããæ©èœãæã¡ãŸãã以äžã®ããã«è¶
çæãçæãé·æã®3ã€ã®ã¡ã¢ãªã¹ãã¢ã掻çšããããšã§éåžžã«é·ãæ åã§ãå°ãªãGPUã¡ã¢ãªäœ¿çšéã§é«å質ãªç¹åŸŽãæããããšãã§ããŸãã æ¬¡ã®å³ã¯1ãã¬ãŒã ã«ãããåŠçãããå
·äœçã«ç€ºãããã®ã«ãªããŸãã Memory reading å
šäœåã§ç€ºãããŠããMemory readingæäœã¯äžå³ã®Query, Affinity, Readout featuresã®äžé£ã®æµãã«è©²åœããWorking memoryãšLong-term memoryããæé©ãªç¹åŸŽé ãåãåºããDecoderãéãããšã§æšå®ãã¹ã¯ãçæããŸãã Working memoryãšLong-term memoryã§äœ¿ãããŠããã¡ã¢ãªã¯ãæ¢åææ³ã®STCNãšåæ§ã®ãã®ã§ããããã«ã¯Query encoderã«ãã£ãŠãšã³ã³ãŒããããå
¥åç»åãkeyãšããValue encoderã«ãã£ãŠãšã³ã³ãŒããããåºåãã¹ã¯ãvalueãšããèŸæžãä¿åãããŠãããæ°ããå
¥åãããšã³ã³ãŒããããç»åã«æãé©åããvalueãæ¬¡ã®æ¹æ³ã§èªã¿åºããŠããŸãã ãŸãQuery encoderããåºåããã Query ãšãWorking/Long-term Memoryã«ä¿åãããŠããkey ãšã®æ¯èŒããåŸãããé¡äŒŒåºŠè¡åã«å¯ŸããŠsoftmaxãé©çšããããšã§ãAffinityãšåŒã°ããè¡å ãçæããŸãããããŠãããåºã«Memoryäžã®value ãéã¿ã¥ãããã® ãMemory readingã®åºå ãšããŸãã ãã®Affinityãèšç®ãããšããSTCNã§ææãããŠããããã«é¡äŒŒåºŠè¡åã®èšç®ã«L2è·é¢ãå©çšãããšdot product 27 ãããå®å®ããããã§ããããããæ¬¡ã®å³ã®(a)ã§ç€ºããŠããããã«å
šãŠã®ã¡ã¢ãªèŠçŽ ãäžåŸã«èæ
®ããŠããããããããã®ä¿¡é ŒåºŠã笊å·åã§ããªã衚çŸåã®ä¹ãããé£ç¹ã§ããããã§ææ¡ææ³ã§ã¯åçž®é
, éžæé
ãçšããŠæ¬¡ã®åŒ(2)ã®ããã«é¡äŒŒåºŠã衚çŸããããšã§å³ã®(c), (d)ã®ããã«è€éãªé¡äŒŒåºŠé¢ä¿ã®ã¢ããªã³ã°ãå¯èœãšããŠããŸãã æ¬¡ã®ç¯ã§ã¯Working memoryãšLong-term memoryã®æŽæ°æ¹æ³ã説æããŸãã Working memory Working memoryã¯é«è§£å床ã®ç¹åŸŽãäžæçã«ä¿åããŠããŸããäžè¿°ã®éãå
¥åç»åã®ãšã³ã³ãŒãçµæã§ããQuery ãšäºæž¬ããããã¹ã¯ã®ãšã³ã³ãŒãçµæã§ããValueã®èŸæžãããªãã ãã¬ãŒã ããšã«QueryãšValueã®çµïŒä»¥éãšã³ããªãšåŒã³ãŸãïŒã远å ãããŸãã ã¡ã¢ãªç¯çŽã®ããã«ããšã³ããªæ°ãããéŸå€ ãè¶
ãããšãæ°ããã®ããã€ãã®ãšã³ããªãšããŠãŒã¶ãŒã«ã¢ãããŒã·ã§ã³ããããã¬ãŒã ããšã³ã³ãŒããããŠããæåã®ãšã³ããªã®ã¿ãæ®ããŠLong-term memoryã«åŒãæž¡ããŸãã Long-term memory Working-memoryããæž¡ããããšã³ããªãã¡ ã¯ã次ã®å³ããã«ãããã¿ã€ããšåŒã°ãããšã³ããªãã¡ ã«å§çž®ãããŠããLong-term memoryã®èŸæžã«ä¿åãããŸãã ãŸãå³äžã®Prototype selectionã«ãããéšåã§ çµã®ãšã³ããªã ã®ã°ãªããã«åå²ããŠããã® åã®äžãããããŸã§ã«æãå€ãã¢ã¯ã»ã¹ããã åã®ãããããããã¿ã€ãã®key ãšããŠéžæããŸãããã®æã¢ã¯ã»ã¹æ°ã¯ããããŸã§èšç®ããAffinityã®çޝç©åãåãããšã§èšç®ããŠããŸãã æ¬¡ã«PotentiationãšããŠããããã¿ã€ãã®keyã«å¯Ÿå¿ããvalueã ããããŸãéã¿ä»ãããŠçæããŸããå
·äœçã«ã¯ãããã¿ã€ãã®keyïŒå³äžã®æããŒã¯ïŒã«é¡äŒŒããã°ãªãããæ€çŽ¢ããç¹åŸŽéãéçŽããŠãã®keyã«å¯Ÿå¿ããvalueïŒéè²ã§å²ã£ãŠããæããŒã¯ïŒãçæããŸãããã®çµæãšããŠãããã¿ã€ãã®ãšã³ããªãLong-term memoryã«ä¿åãããŸãã æ¬¡ã®å³ã¯ãLong-term memoryã®åŠçãå¯èŠåãããã®ã§ããæäžæ®µã®ç»åãWorking memoryããæž¡ããããšã³ããªã«å¯Ÿå¿ããå
¥åãã¬ãŒã ã§ããé»è²ã®ååããããã¿ã€ãã®äœçœ®ã衚ããŠãããããã«é¡äŒŒããç®æã¯èµ€è²ã§è¡šç€ºãããŠããŸãããŸãããããã¿ã€ãã瀺ããã¬ãŒã ã¯èµ€æ ã§è¡šç€ºãããŠããŸããå
·äœçãªé£çµåŠçã§ã¯ãçœé³¥ã®ã¯ããã·ïŒ2è¡ç®ïŒãæ€çã®äžéšïŒ3è¡ç®ïŒãå·å²žã®äžéšïŒ4è¡ç®ïŒãæ€çãšå·å²žã®å¢ç(5è¡ç®)ãæ°Žé¢ã®äžéš(6è¡ç®)ãšããæå³ã®ããæ
å ±ãéçŽãããŠããŸãã Sensory memory Working/Long-term memoryããèªã¿åºããå€ããã³ãŒãããéã«ãSensory memoryãšåŒã°ãããWorking memoryãããããã«çæéã®æ
å ±ãä¿æããã¡ã¢ãªããæé屿æ§ã®é«ãç¹åŸŽéããã³ãŒãã«å ããŠããŸãããã®Sensory memoryã®æŽæ°ã¯ä»¥äžã®ããã«è¡ãããŸãã æ¬¡ã®å³ã¯Sensory memory ã®æŽæ°ã瀺ããŠããŸããDecoderããã®ãã«ãã¹ã±ãŒã«ç¹åŸŽãããŠã³ãµã³ããªã³ã°ããŠGRUãžã®å
¥åãšããŠé£çµããŸãã ãã¬ãŒã ããšã«Working memoryã®æŽæ°ãšãšãã«è¡ãããDeep Updateã§ã¯ãWorking memoryãžã®å
¥åãšå¥ã®GRUã䜿ã£ãŠã¡ã¢ãªãæŽæ°ããŸããããã«ããæ¢ã«Working memoryã«ä¿åãããã§ãããåé·ãªæ
å ±ããæå°éã®ãªãŒããŒãããã§Sensor memoryããç Žæ£ã§ããŸãã 以äžãXMemã®åŠçå
容ã§ããWorking memoryã§çæçãªèšæ¶ããLong-term memoryãé·æçãªèšæ¶ãä¿æãããããããåãåºããç¹åŸŽãSensory memoryã®æ
å ±ãšåãããããšã§æšè«ã®æéçé£ç¶æ§ãæ
ä¿ããŠããããšãããããšæããŸãã ã㢠GitHubããŒãž ã«ãã¢ãèŒã£ãŠããŸãã10åãããåç»ã«å¯ŸããŠãããŸã察象ã®äººç©ããã¹ã¯ã§ããŠããããšãããããŸãã ææ³ Atkinson-Shiffrin memory modelã®3ã€ã®èšæ¶ã¢ãã«ãé©åãªãããã¯ãŒã¯ã«èœãšã蟌ãã§èšèšããŠããç¹ãè峿·±ãã£ãã§ãã æåŸã« æ¬ããã°ã§ã¯ãç§ãã¡ãèå³ãæã£ãECCV2022ã®è«æã«ã€ããŠã玹ä»ããŸãããNTT Comã§ã¯ãä»åã玹ä»ããè«æèª¿æ»ãç»åãæ åãæŽã«ã¯é³å£°èšèªãå«ããæ§ã
ãªã¡ãã£ã¢AIæè¡ã®ç ç©¶éçºã«ä»åŸãç©æ¥µçã«åãçµãã§ãããŸãã ã¢ã«ãããã¯ãªç ç©¶ã«æ³šåãããããè«æãæžããã ææ°ã®æè¡ããã¡æ©ãåãå
¥ãå®çšåã«çµã³ä»ããã AIã¢ã«ãŽãªãºã ã«å ããAI/MLã·ã¹ãã å
šäœã®æé©ãªèšèšã暡玢ããã ãšããæ¹ã
ã«æŽ»èºããŠããã ãããã£ãŒã«ããNTT Comã«ã¯å€ããããŸããæ°åæ¡çšã®æ
å ±ã«ã€ããŠã¯ ãã¡ãã®ããŒãž ãã芧ãã ããã ä»åŸãç§ãã¡ã®åãçµã¿ãããã°çã§çºä¿¡ããŠãããŸãã®ã§ãèå³ãæã£ãŠãã ãã£ãæ¹ã¯æ¯éä»åŸããæ³šç®ãã ããïŒ Muller, M., Bibi, A., Giancola, S., Alsubaihi, S., Ghanem, B.: Trackingnet: A largescale dataset and benchmark for object tracking in the wild. In: ECCV (2018) 1, 9, 10, 20 ↩ Fan, H., Lin, L., Yang, F., Chu, P., Deng, G., Yu, S., Bai, H., Xu, Y., Liao, C., Ling, H.: LaSOT: A high-quality benchmark for large-scale single object tracking. In: CVPR (2019) 1, 4, 9, 10, 20 ↩ Milan, A., Leal-TaixÂŽe, L., Reid, I., Roth, S., Schindler, K.: MOT16: A benchmark for multi-object tracking. arXiv preprint arXiv:1603.00831 (2016) 1, 4, 10, 11, 20 ↩ Yu, F., Chen, H., Wang, X., Xian, W., Chen, Y., Liu, F., Madhavan, V., Darrell, T.: BDD100K: A diverse driving dataset for heterogeneous multitask learning. In: CVPR (2020) 1, 2, 4, 10, 11, 12, 20 ↩ Pont-Tuset, J., Perazzi, F., Caelles, S., ArbelÂŽaez, P., Sorkine-Hornung, A., Van Gool, L.: The 2017 davis challenge on video object segmentation. arXiv preprint arXiv:1704.00675 (2017) 1, 4, 11, 20 ↩ Voigtlaender, P., Krause, M., Osep, A., Luiten, J., Sekar, B.B.G., Geiger, A., Leibe, B.: MOTS: Multi-object tracking and segmentation. In: CVPR (2019) 2, 4, 12, 13, 20 ↩ Lukezic, A., Matas, J., Kristan, M.: D3S-a discriminative single shot segmentation tracker. In: CVPR (2020) 2, 4, 10, 12 ↩ Voigtlaender, P., Luiten, J., Torr, P.H., Leibe, B.: Siam R-CNN: Visual tracking by re-detection. In: CVPR (2020) 2, 3, 4, 10, 12 ↩ Meinhardt, T., Kirillov, A., Leal-Taixe, L., Feichtenhofer, C.: TrackFormer: Multiobject tracking with transformers. arXiv preprint arXiv:2101.02702 (2021) 2, 3, 4, 11, 13 ↩ Wu, J., Cao, J., Song, L., Wang, Y., Yang, M., Yuan, J.: Track to detect and segment: An online multi-object tracker. In: CVPR (2021) 2, 4, 5, 11, 13 ↩ Wang, Q., Zhang, L., Bertinetto, L., Hu, W., Torr, P.H.S.: Fast online object tracking and segmentation: A unifying approach. In: CVPR (2019) 2, 4, 5, 12 ↩ Lukezic, A., Matas, J., Kristan, M.: D3S-a discriminative single shot segmentation tracker. In: CVPR (2020) 2, 4, 11, 12 ↩ Liu, Z., Lin, Y., Cao, Y., Hu, H., Wei, Y., Zhang, Z., Lin, S., Guo, B.: Swin transformer: Hierarchical vision transformer using shifted windows. In: Proceedings of the IEEE/CVF International Conference on Computer Vision. pp. 10012â10022 (2021) ↩ Zhu, X., Su, W., Lu, L., Li, B., Wang, X., Dai, J.: Deformable detr: Deformable transformers for end-to-end object detection. arXiv preprint arXiv:2010.04159 (2020) ↩ Dosovitskiy, A., Fischer, P., Ilg, E., Hausser, P., Hazirbas, C., Golkov, V., Van Der Smagt, P., Cremers, D., Brox, T.: Flownet: Learning optical flow with convolutional networks. In: Proceedings of the IEEE international conference on computer vision. pp. 2758â2766 (2015) ↩ Zhu, X., Wang, Y., Dai, J., Yuan, L., Wei, Y.: Flow-guided feature aggregation for video object detection. In: Proceedings of the IEEE international conference on computer vision. pp. 408â417 (2017) ↩ Meinhold, R.J., Singpurwalla, N.D.: Understanding the kalman filter. The American Statistician 37(2), 123â127 (1983) ↩ Zeng, F., Dong, B., Wang, T., Zhang, X., Wei, Y.: Motr: End-to-end multipleobject tracking with transformer. arXiv preprint arXiv:2105.03247 (2021) ↩ Xu, Y., Ban, Y., Delorme, G., Gan, C., Rus, D., Alameda-Pineda, X.: Transcenter: Transformers with dense queries for multiple-object tracking. arXiv preprint arXiv:2103.15145 (2021) ↩ Peter Sand and Seth Teller: Particle Video: Long-Range Motion Estimation using Point Trajectories. In: CVPR (2006) ↩ Zachary Teed and Jia Deng: RAFT: Recurrent All-Pairs Field Transforms for Optical Flow. In: ECCV (2020) ↩ Atkinson, R.C., Shiffrin, R.M.: Human memory: A proposed system and its control processes. In: Psychology of learning and motivation, vol. 2, pp. 89â195. Elsevier (1968) ↩ Liang, Y., Li, X., Jafari, N., Chen, J.: Video object segmentation with adaptive feature bank and uncertain-region refinement. In: NeurIPS (2020) ↩ Oh, S.W., Lee, J.Y., Xu, N., Kim, S.J.: Video object segmentation using space-time memory networks. In: ICCV (2019) ↩ Yang, Z., Wei, Y., Yang, Y.: Associating objects with transformers for video object segmentation. In: NeurIPS (2021) ↩ Cheng, H.K., Tai, Y.W., Tang, C.K.: Rethinking space-time networks with improved memory coverage for efficient video object segmentation. In: NeurIPS (2021) ↩ Oh, S.W., Lee, J.Y., Xu, N., Kim, S.J.: Video object segmentation using space-time memory networks. In: ICCV (2019) ↩