Skip to yearly menu bar Skip to main content


Findings Poster Session

Findings Poster Session 1

Fri 5 Jun 6 a.m. PDT — 7:30 a.m. PDT
Abstract:
Chat is not available.


1
BLMT-Stereo: Breaking the Local Minima Trap of Iterative Stereo Matching

Zhien Dai, Zhaohui Tang, Hu Zhang, Mingjun Pan, Jin Luo, Yongfang Xie


2
SwiftNDC: Fast Neural Depth Correction for High-Fidelity 3D Reconstruction

Kang Han, Wei Xiang, Lu Yu, Mathew Wyatt, Gaowen Liu, Ramana Rao Kompella


5
4D E-SloMo: 4D Reconstruction for High Speed Scene using a Hybrid RGB-Event Multi-View System

Bo Xu, Jun Dai, Yutian Chen, Linning Xu, Mulin Yu, Yujin Wang, Shi Guo, Xinyi Le, Tianfan Xue


6
MADrive: Memory-Augmented Driving Scene Modeling

Polina Karpikova, Daniil Selikhanovych, Kirill Struminsky, Ruslan Musaev, Maria Golitsyna, Dmitry Baranchuk


8
SyncTrack4D: Cross-Video Motion Alignment and Video Synchronization with Multi-Video 4D Gaussian Splatting

Yonghan Lee, Tsung-Wei Huang, Shiv Gehlot, Jaehoon Choi, Guan-Ming Su, Dinesh Manocha


9
AR4D: Autoregressive 4D Generation from Monocular Videos

Hanxin Zhu, Tianyu He, Zhibo Chen


10
CLLAP: Contrastive Learning-based LiDAR-Augmented Pretraining for Enhanced Radar-Camera Fusion

Bingyi Liu, Chuanhui Zhu, Hongfei Xue, Jian Teng, Jipeng Liu, Enshu Wang, Penglin Dai, Pu Wang


12
Speed3R: Sparse Feed-forward 3D Reconstruction Models

Weining Ren, Xiao Tan, Kai Han


13
FF3R: Feedforward Feature 3D Reconstruction from Unconstrained views

Chaoyi Zhou, Run Wang, Feng Luo, Mert D. Pesé, Zhiwen Fan, Yiqi Zhong, Siyu Huang


16
WildAni4D: Towards 4D Animal Mesh Reconstruction

Gyeongsu Cho, Hezhen Hu, Donghyeon Soon, Changwoo Kang, Kyungdon Joo


17
Instant Colorization of Gaussian Splats

Daniel Lieber, Alexander Mock, Nils Wandel


19
LangFlash: Feed-forward 3D Language Gaussian Splatting from Sparse Unposed Images

Yilong Liu, Wanhua Li, Chen Zhu-Tian, Hanspeter Pfister


20
FACT-GS: Frequency-Aligned Complexity-Aware Texture Reparameterization for 2D Gaussian Splatting

Tianhao Xie, Linlian Jiang, Xinxin Zuo, Yang Wang, Tiberiu Popa


21
Affine Bases for Affine Spaces

Gabriel Dogadov, Marc Alexa


22
Improving Densification in 3D Gaussian Splatting for High-Fidelity Rendering

Xiaobin Deng, Changyu Diao, Min Li, Ruohan Yu, Duanqing Xu


23
OpenTrack3D: Towards Accurate and Generalizable Open-Vocabulary 3D Instance Segmentation

Zhishan Zhou, Siyuan Wei, Zengran Wang, Chunjie Wang, Xiaosheng Yan, Xiao Liu


24
GeoFusion-CAD: Structure-Aware Diffusion with Geometric State Space for Parametric 3D Design

Xiaolei Zhou, Chuangjie Fang, Jie Wu, Jingyi Yang, Boyi Lin, Jianwei Zheng


25
SPIDER: Spatial Image CorresponDence Estimator for Robust Calibration

Zhimin Shao, Abhay Yadav, Rama Chellappa, Cheng Peng


28
2D Triangle Splatting for Direct Differentiable Mesh Training

Kaifeng Sheng, Zheng Zhou, Yingliang Peng, Qianwei Wang


29
ForgeDreamer: Industrial Text-to-3D Generation with Multi-Expert LoRA and Cross-View Hypergraph

Junhao Cai, Deyu Zeng, Junhao Pang, Lini Li, Xiaopin Zhong, Zongze Wu


31
IDSplat: Instance-Decomposed 3D Gaussian Splatting for Driving Scenes

Carl Lindström, Mahan Rafidashti, Maryam Fatemi, Lars Hammarstrand, Martin R. Oswald, Lennart Svensson


33
Active Exploration for Sparse Visual Localization

Johanna Lidholm, Ludvig Dillén, Zuzana Kukelova, Torsten Sattler, Viktor Larsson


34
GRVS: a Generalizable and Recurrent Approach to Monocular Dynamic View Synthesis

Thomas Tanay, Mohammed Brahimi, Michal Nazarczuk, Qingwen Zhang, Sibi Catley-Chandar, Arthur Moreau, Zhensong Zhang, Eduardo Pérez-Pellitero


36
Long-LRM++: Preserving Fine Details in Feed-Forward Wide-Coverage Reconstruction

Chen Ziwen, Hao Tan, Peng Wang, Zexiang Xu, Li Fuxin


37
Native3D: End-to-End 3D Scene Generation via Unified Mesh-Texture Modeling and Semantic Alignment

Yibo Liu, Ziwei Zhang, Haozhou Pang, Menghao Li, Lanshan He, Gan Qi


38
From Orbit to Ground: Generative City Photogrammetry from Extreme Off-Nadir Satellite Images

Fei Yu, Yu Liu, Luyang Tang, Mingchao Sun, Zengye Ge, Rui Bu, Yuchao Jin, Haisen Zhao, He Sun, Yangyan Li, Mu Xu, Wenzheng Chen, Baoquan Chen


39
NeVStereo: A NeRF-Driven NVS-Stereo Architecture for High-Fidelity 3D Tasks

Pengcheng Chen, Yue Hu, Wenhao Li, Nicole M Gunderson, Andrew Feng, Zhenglong Sun, Peter Beerel, Eric J Seibel


40
VGGT4D: Mining Motion Cues in Visual Geometry Transformers for 4D Scene Reconstruction

Yu Hu, Chong Cheng, Sicheng Yu, Xiaoyang Guo, Hao Wang


42
Object Pose Transformer: Unifying Unseen Object Pose Estimation

Weihang Li, Lorenzo Garattoni, Fabien Despinoy, Nassir Navab, Benjamin Busam


43
SwiftVGGT: A Scalable Visual Geometry Grounded Transformer for Large-Scale Scenes

Jungho Lee, Minhyeok Lee, Sunghun Yang, Minseok Kang, Sangyoun Lee


44
CATRF: Codec-Adaptive TriPlane Radiance Fields for Volumetric Content Delivery

Tung-I Chen, Lingdong Wang, Subhransu Maji, Ramesh K. Sitaraman


45
PDF-GS: Progressive Distractor Filtering for Robust 3D Gaussian Splatting

Kangmin Seo, MinKyu Lee, Tae-Young Kim, ByeongCheol Lee, JoonSeoung An, Jae-Pil Heo


46
Three-Step Conditional Diffusion 3D Reconstruction for Light-Field Microscopy

Qihong Zhao, Shaokang Yan, Zhimin Qiao, Jinjia Wang, Bo Xiong


47
LTGS: Long-Term Gaussian Scene Chronology From Sparse View Updates

Minkwan Kim, Seungmin Lee, Junho Kim, Young Min Kim


48
Learning a Particle Dynamics Model with Real-World Videos

Chanho Kim, Suhas V. Sumukh, Li Fuxin


49
Softmax-GS: Generalized Gaussians Learning When to Blend or Bound

Chen Ziwen, Peng Wang, Hao Tan, Zexiang Xu, Li Fuxin


51
3D-RE-GEN: 3D Reconstruction of Indoor Scenes with a Generative Framework

Tobias Sautter, Jan-Niklas Dihlmann, Hendrik P A Lensch


53
RiGS: Rigid-aware 4D Gaussian Splatting from a Single Monocular Video

Chenyu Wu, Wanhua Li, Chen Zhu-Tian, Hanspeter Pfister


55
WGS: Watertight Geometry Standardization for Scalable 3D Generation

Dehao Hao, Tanghui Jia, Kaiyi Zhang, Weikai Chen, Zeyu Hu, Yingda Yin, Runze Zhang, Lingting Zhu, Li Yuan, Xin Wang, Long Quan


56
Self-Evolving 3D Scene Generation from a Single Image

Kaizhi Zheng, Yue Fan, Jing Gu, Zishuo Xu, Xuehai He, Xin Eric Wang


57
Distill Any Depth: Distillation Creates a Stronger Monocular Depth Estimator

Xiankang He, Dongyan Guo, Hongji Li, Ying Cui, Libo Weng, Ruibo Li, Chi Zhang


59
UniVerse3D: Emerging Properties of Unified Multimodal Models in 3D Understanding and Generation

Junliang Ye, Zehuan Huang, Yansong Qu, Chunshi Wang, Yunhan Yang, Yang Li, Yawei Luo, Zhuo Chen, Sheng Lu, Jun Zhu, Chunchao Guo


60
HumanOrbit: 3D Human Reconstruction as 360° Orbit Generation

Keito Suzuki, Kunyao Chen, Lei Wang, Bang Du, Runfa Blark Li, Peng Liu, Ning Bi, Truong Nguyen


61
Beyond Voxel 3D Editing : Learning from 3D Masks and Self-Constructed Data

Yizhao Xu, Hongyuan Zhu, Caiyun Liu, Tianfu Wang, Keyu Chen, Sicheng Xu, Jiaolong Yang, Nicholas jing Yuan, Qi Zhang


62
Adversarial Agents: Black-Box Evasion Attacks with Reinforcement Learning

Kyle Domico, Jean-Charles Noirot Ferrand, Ryan Sheatsley, Eric Pauley, Josiah Hanna, Patrick McDaniel


65
NSGuard: Null-Space Guided Robust Watermarking for Data Copyright Protection in Customized Generation

Lizhi Xiong, Jianguo Feng, Ziqiang Li, Jun Li, Weiwei Jiang, Zhangjie Fu


66
A Robust Out-of-Distribution Detection Framework via Synergistic Smoothing

Maria Stoica, Abdelrahman Hekal, Alessio Lomuscio


68
BadRSSD: Backdoor Attacks on Regularized Self-Supervised Diffusion Models

Jiayao Wang, Yiping Zhang, Mohammad Maruf Hasan, Xiaoying Lei, Jiale Zhang, Junwu Zhu, Qilin Wu, Dongfang Zhao


71
Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models

Songlong Xing, Weijie Wang, Zhengyu Zhao, Jindong Gu, Philip Torr, Nicu Sebe


72
Breaking the Illusion: Consensus-Based Generative Mitigation of Adversarial Illusions in Multi-Modal Embeddings

Fatemeh Akbarian, Anahita Baninajjar, Yingyi Zhang, Ananth Balashankar, Amir Aminifar


75
DRA: Structure-Preserving Backdoor Erasure via Diagnosing, Recalibrating, and Adapting

Minwei Wen, Yang Wei, Junhao Xiao, Xiuli Bi, Bin Xiao


77
Cognitive Attack Detection in Augmented Reality (CADAR): A Neuro-Symbolic Approach with Particle Filtering on Perception Graphs

Rongqian chen, Allison Andreyev, Yanming Xiu, Joshua Chilukuri, Shunav Sen, Mahdi Imani, Bin Li, Maria Gorlatova, Gang Tan, Tian Lan


78
On Evaluating Stateful Defence Models against Query-Based Black-Box Attacks

Ziad Tariq Muhammad Ali, Raja Muhammad Atif Azad, Muhammad Ajmal Azad, Iain Rice, Umar Daraz, Ali Shariq Imran, James Holyhead


84
DeepFakeShield: A Proactive Defense Against Malicious Face Swapping

Saeed Karimi-Bidhendi, Joseph DeGol, Eric Wengrowski, Dominic Roberts, Kristin Dana


85
MDG: Masked Denoising Generation for Multi-Agent Behavior Modeling in Traffic Environments

Zhiyu Huang, Zewei Zhou, Tianhui Cai, Yun Zhang, Jiaqi Ma


86
LiDAR-to-4D Radar Synthesis for Building Large-Scale Tensor Datasets

Woo-Jin Jung, Dong-Hee Paek, Seung-Hyun Kong


87
SurfaceGS: Dynamic Surface Gaussian Splatting for Urban Driving Scenes

Fudong Ge, Dingning Liu, Hanshi Wang, Yiwei Zhang, Jin Gao, Weiming Hu, Zhipeng Zhang


88
JACoP: Joint Alignment for Compliant Multi-Agent Prediction

Qingze Tony Liu, Alen Mrdovic, Danrui Li, Mathew Schwartz, Sejong Yoon, Mubbasir Kapadia


89
Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving

Zhexi Lian, Haoran Wang, Xuerun Yan, Weimeng Lin, Xianhong Zhang, Yongyu Chen, Jia Hu


90
What Matters for Scalable and Robust Learning in End-to-End Driving Planners?

David Holtz, Niklas Hanselmann, Simon Doll, Marius Cordts, Bernt Schiele


91
Physics-Informed Reward Framework for Vision-Language Driven Safe Autonomous Driving

Xuepei Yang, Mingtao Feng, Weisheng Dong, Lin Chen, Jie Feng, Fangfang Wu, Yufan Zhu, Ajmal Saeed Mian


92
HorizonWeaver: Generalizable Multi-Level Semantic Editing for Driving Scenes

Mauricio Soroco, Francesco Pittaluga, Zaid Tasneem, Abhishek Aich, Bingbing Zhuang, Wuyang Chen, Manmohan Chandraker, Ziyu Jiang


93
VESPA: Open-World Auto-Labeling for 3D Object Detection in Autonomous Driving

Levente Tempfli, Esteban Rivera, Markus Lienkamp


94
IRL-VLA: Vision-Language-Action Training via Reward World Model

Anqing Jiang, Gao Yu, Heng Yuwen, Yiru Wang, Wang Shuo, Jiang Hao, Sun Hao


95
KnowMTP: A Knowledge-Guided Framework for Multi-Agent Trajectory Prediction in Autonomous Driving

Rufan Bai, Tianyi Xue, Tiantian Zhou, Weiwei Wu, Changle Li, Yuhuan Lu


96
MapGPT: A Vision-Language Model for Large-Scale High-Definition Map Generation

Mengxi Wu, Long Zhou, Zhixia Li, Adrian Kwan, Denis Laprise, Hengyi Huang, Xiaqing Wu, Shuang Wu


97
RoaD: Rollouts as Demonstrations for Closed-Loop Supervised Fine-Tuning of Autonomous Driving Policies

Guillermo Garcia-Cobo, Maximilian Igl, Peter Karkus, Zhejun Zhang, Michael Watson, Yuxiao Chen, Boris Ivanovic, Marco Pavone


98
PAVE: An End-to-End Dataset for Production Autonomous Vehicle Evaluation

Xiangyu Li, Chen Wang, Yumao Liu, Dengbo He, Jiahao Zhang, Ke Ma


99
RoadTones: Tone Controllable Text Generation from Road Event Videos

Chirag Parikh, Siddhi Pravin Lipare, Ravi Kiran Sarvadevabhatla


100
GRADE: Guiding Realistic Autonomous Driving with Adaptive Trajectory Evolution

Zehong Ke, Zhiyuan Liu, Yuning Wang, Jinhao Li, Junkai Jiang, Yanbo Jiang, Zhenhua Xu, Jianqiang Wang


101
SurfelOcc: Self-supervised Occupancy Prediction via 2D Surfel Splatting

Jikai Wang, Xingtai Gui, Jiahao Gong, Feiyang Tan, Wencheng Han, Cheng-Zhong Xu, Jianbing Shen


102
dVLM-AD: Enhance Diffusion Vision-Language-Model for Driving via Controllable Reasoning

Yingzi Ma, Yulong Cao, Wenhao Ding, Shuibai Zhang, Yan Wang, Boris Ivanovic, Ming Jiang, Marco Pavone, Chaowei Xiao


103
Devil is in Narrow Policy: Unleashing Exploration in Driving VLA Models

Canyu Chen, Yuguang Yang, Zhewen Tan, Yizhi Wang, Ruiyi Zhan, Haiyan Liu, Xuanyao Mao, Jason Bao, Xinyue Tang, Linlin Yang, Bingchuan Sun, Yan Wang, Baochang Zhang


104
Learning Vision-Language-Action World Models for Autonomous Driving

Guoqing Wang, Pin Tang, Xiangxuan Ren, Guodongfang Zhao, Bailan Feng, Chao Ma


105
AD-R1: Closed-Loop Reinforcement Learning for End-to-End Autonomous Driving with Impartial World Models

Tianyi Yan, Tao Tang, Xingtai Gui, Yongkang Li, Jiasen Zheng, Weiyao Huang, Lingdong Kong, Wencheng Han, Xia Zhou, Xueyang Zhang, Yifei Zhan, Kun Zhan, Cheng-zhong Xu, Jianbing Shen


107
OmniDrive-R1: Reinforcement-driven Interleaved Multi-modal Chain-of-Thought for Trustworthy Vision-Language Autonomous Driving

Zhenguo Zhang, Haohan Zheng, Yishen Wang, Le Xu, Tianchen Deng, Xuefeng Chen, Qu Chen, Bo Zhang, Wuxiong Huang


109
C^2T: Captioning-Structure and LLM-Aligned Common-Sense Reward Learning for Traffic–Vehicle Coordination

Yuyang Chen, Kaiyan Zhao, Yiming Wang, Ming Yang, Bin Rao, Zhenning Li


111
Variable-View Diffusion with Geometric Uncertainty Unlocks LiDAR Upsampling

Pengfei Yang, Sifu Luo, Feng Wu, Fan Zhou, Ting Zhong


113
On the Feasibility and Opportunity of Autoregressive 3D Object Detection

Zanming Huang, Jinsu Yoo, Sooyoung Jeon, Zhenzhen Liu, Mark Campbell, Kilian Q Weinberger, Bharath Hariharan, Wei-Lun Chao, Katie Z Luo


114
See Tomorrow, Act Today: Foresight-Driven Autonomous Driving

Bozhou Zhang, Nan Song, Yuang Wang, Jiankang Deng, Xiatian Zhu, Li Zhang


115
Spatial Transcriptomics as Images for Large-Scale Pretraining

Yishun Zhu, Jiaxin Qi, Jian Wang, Yuhua Zheng, Jianqiang Huang


117
Modality-Aware and Anatomical Vector-Quantized Autoencoding for Multimodal Brain MRI

Mingjie Li, Edward Kim, Yue Zhao, Ehsan Adeli, Kilian M. Pohl


118
Fingerprint Fragment Expansion using Image Outpainting Approach based on Spectral Normalization PatchGAN

C. Zaghetto, A. Purim, W. Oliveira, J. R. Ribeiro, H. Nolla, F. Santos, M. Chang, R. H. Vareto


120
Intelligent Photo Retouching with Language Model-Based Artist Agents

Haoyu Chen, Keda Tao, YiZao Wang, Xinlei Wang, Lei Zhu, Jinjin Gu


121
Guided Lensless Polarization Imaging

Noa Kraicer, Erez Yosef, Raja Giryes


123
Towards Imperceptible Watermarking Via Environment Illumination for Consumer Cameras

Hodaka Kawachi, Tomoya Nakamura, Hiroaki Santo, SaiKiran Kumar Tedla, Trevor D Canham, Yasushi Yagi, Michael S. Brown


124
Adaptive Continuous Kernel Networks for Image Reconstruction from Non-Uniform Sampling

Camille Biscarrat, Michaël Gharbi, Rahul Goel, Jonathan Ragan-Kelley, Frédo Durand, Tzu-Mao Li


128
Fast Generative DeOcclusion for Visual Geometry and Robotics

Jieneng Chen, Tiezheng Zhang, Xiwei Xuan, Ju He, Yifan Yin, Haojun Shi, Suyu Ye, Xinyi Li, Ruisheng Yuan, Tianmin Shu, Alan Yuille


129
FineCog-Nav: Integrating Fine-grained Cognitive Modules for Zero-shot Multimodal UAV Navigation

Dian Shao, Zhengzheng Xu, Peiyang Wang, Like Liu, Yule Wang, Jieqi Shi, Jing Huo


130
Unlocking Single-View Constraints for Efficient Camera Relocalization with Keypoint-Level Multi-View Geometric Consistency in Training

Hu Lin, Chengjiang Long, Jiqing Zhang, Chuanlu Jiang, Huilin Ge, Erwei Yin, Baocai Yin, Xin Yang


131
Evolve Vision-Language-Action Model into an Agent with On-the-fly Tool-use

Ding Yi, Yanzhao Yu, Xili Dai, Xianbiao Qi, Peiwen Sun, Xueqian Wang, Xiangyu Yue, Jianan Wang


132
Retrieval-VLA: Training-Free In-Context Adaptation for Vision-Language-Action Models

Yue Zhang, Rui Wang, Jiehong Lin, Zhongrui Wang, Xiaojuan Qi


133
Revisiting Articulated Parts Perception in Robot Manipulation

Xiaoqian Wu, Yejie Guo, Xiaoyang Chen, Lixin Yang, Cewu Lu, Yong-Lu Li


134
Re^2MoGen: Open-Vocabulary Motion Generation via LLM Reasoning and Physics-Aware Refinement

Jiakun Zheng, Ting Xiao, Shiqin Cao, Xinran Li, Zhe Wang, Chenjia Bai


135
Teleoperation, Simulation, or Human Video? Data Utilization Law for Robot Manipulation

Chenhao Shi, Yichen Zhu, Junjie Wen, Yefei Chen, Ziang Liu, Faming Fang


137
RoboTransfer: Controllable Geometry-Consistent Video Diffusion for Manipulation Policy Transfer

Liu Liu, Xiaofeng Wang, Guosheng Zhao, Keyu Li, Wenkang Qin, Jiagang Zhu, Jiaxiong Qiu, Guan Huang, Zhizhong Su


138
Switch-JustDance: Benchmarking Whole-Body Motion Tracking Controllers Using a Commercial Console Game

Jeonghwan Kim, Wontaek Kim, Yidan Lu, Jin Cheng, Fatemeh Zargarbashi, Zicheng Zeng, Zekun Qi, Zhiyang Dou, Nitish Sontakke, Donghoon Baek, Li Yi, Sehoon Ha, Tianyu Li


140
ReaAct: Bridging Robotic Reasoning and Action Generation Toward Real-World Spatial Generalization

Yanzhao Yu, Yi Ding, Peijun Tang, Haotian Yang, Xianbiao Qi, Jianan Wang, Xueqian Wang


141
Learning Multi-Task Robot Trajectory Segmentation from Visual and Kinematic Streams

Kaiyuan Chen, Shuangyu Xie, Andrew Goldberg, Ken Goldberg


143
RoboScape-R: Unified Reward-Observation World Models for Generalizable Robotics Training via RL

Yinzhou Tang, Yu Shang, Yinuo Chen, Bingwen Wei, Xin Zhang, Shu'ang Yu, Liangzhi Shi, Chao Yu, Chen Gao, Wei Wu, Yong Li


145
RU4D-SLAM: Reweighting Uncertainty in Gaussian Splatting SLAM for 4D Scene Reconstruction

Yangfan Zhao, Hanwei Zhang, Ke Huang, Qiufeng Wang, Zhenzhou Shao, Dengyu Wu


146
A1: Adaptive Truncated Vision-Language-Action Model from Affordance to Action

Kaidong Zhang, Jian Zhang, Rongtao Xu, Yu Sun, Youpeng Wen, Shuoshuo Xue, Xiaoyu Guo, Minghao Guo, Weijia Liufu, Liu Zihou, Kangyi Ji, Zihang Li, Ruiyi Chen, Meng Cao, Jingming Zhang, Shen Zhao, Xiaojun Chang, Feng Zheng, Ivan Laptev, Xiaodan Liang


147
Ego-Pi: VLA Fine-Tuning for Ego-Centric Human and Robot Data

Ji Woong Kim, Ke Wang, Zipeng Fu, Sirui Chen, Cong zhao, Jeff Lai, Chelsea Finn


149
MiVLA: Towards Generalizable Vision-Language-Action Model with Human-Robot Mutual Imitation Pre-training

Zhenhan Yin, Xuanhan Wang, Jiahao Jiang, Kaiyuan Deng, Pengqi Chen, Shuangle Li, Chong Liu, Xing Xu, Jingkuan Song, Lianli Gao, Heng Tao Shen


150
Riemannian Score-Based Diffusion for Language-Conditioned Grasp and Affordance Detection

Yan Li, Zhouchao Fu, Wenbin Lu, Junjie Zheng, Junnan Xu, Junjie Liao, Jianwei Zheng


151
DINO-VO: Learning Where to Focus for Enhanced State Estimation

Qi Chen, Guanghao Li, Sijia Hu, Xin Gao, Junpeng Ma, Xiangyang Xue, Jian Pu


152
Temporally-Smooth Global Bundle Adjustment for Real-Time Dense Visual SLAM

Cabrel Wouladje, Golden Tendekai Mumanikidzwa, Md Apon Islam, Huiying Xu, Hongbo Li, Wenzhe Tan, Zhendong Chen, Xinzhong Zhu


153
Masked Next-Scale Prediction For Self-Supervised Scene Text Recognition

Zhuohao Chen, Zeng Li, Yifei Zhang, Chang Liu, Yu Zhou


154
iTCTSL: Interpretable Tropical Cyclone Track and Intensity Forecasting via Task Sensitive Learning

Pan Mu, Yuchao Zhu, Shiqi Zhang, Hanting Yan, Jinglin Zhang, Cong Bai


155
Machine Vision-Oriented Appearance Design: Generate Natural And Robust Textures For 3D Meshes

Weihang Ran, Qingtian Zhu, Mingdeng Cao, Wei Yuan, Isao Echizen, Yinqiang Zheng


156
Bridge Your Fields: MeteoNet for Efficient Non-Uniform Meteorological Field Reconstruction

Xuanming Jiang, Baoyi An, Dingyu Nie, Haoyu Ren, Zhengwei Zou, Yizhe Yang, Jialie Shen, Zhiwen Jin, Xueming Qian, Zhongyu Yang, Guoshuai Zhao


157
Catalyst: Out-of-Distribution Detection via Elastic Scaling

Abid Hassan, Tuan Ngo, Saad Shafiq, Nenad Medvidovic


158
LUMINA: Learning and Understanding of Multimodal Information for Narrative and Affect-based Virality Prediction

Jiazhou Lin, Zhongyi Liu, Ying Shi, Zhichun Zhao, Zhuoyu Wang, Yuhang Zhou, Huanling Hu, Guangnan Ye, Mengtian Li, Lei Guo


159
LOOPE: Learnable Optimal Patch Order for Positional Encoders in Vision Transformers

Md Abtahi Majeed Chowdhury, Md Rifat Ur Rahman, Akil Ahmad Taki


160
Watermarking Matters for Deepfake Detection: A Proactive Method for Detecting Forgeries under Conventional Attacks

Zhiqiu Xia, Furong Mu, Qi Li, Shanshan Zhang, Jie Gui, Chunpeng Wang, Yunan Liu


161
CTFS : Collaborative Teacher Framework for Forward-Looking Sonar Image Semantic Segmentation with Extremely Limited Labels

Ping Guo, Chengzhou Li, Guanchen Meng, Qi Jia, Jinyuan Liu, Zhu Liu, Yu Liu, Zhongxuan Luo, Xin Fan


162
TPTransformer: Tensor–Tensor Product Transformer for Hyperspectral Image Super-Resolution

Honghui Xu, Chuangjie Fang, Yiqun Meng, Jiawei Jiang, Sixian Chan, Shiqing Zhang, Jianwei Zheng


164
The Mechanics of CNN Filtering with Rectification

Liam Frija-Altarac, Matthew Toews


165
AndroidLong: LLM-based Android Agents Struggle with Long Looping Tasks

Xinghan Liu, Xiao Liu, Yifan Xu, Jiaqi Fu, Jiayu Huang, Yixuan Liu, Yuxiao Dong, Jie Tang


166
Multimodal Large Language Models as Image Classifiers

Nikita Kisel, Illia Volkov, Klara Janouskova, Jiri Matas


167
Beyond Recognition: Evaluating Visual Perspective Taking in Vision Language Models

Gracjan Góral, Alicja Ziarko, Piotr Miłoś, Michał Nauman, Maciej Wołczyk, Michał Kosiński


168
Exploring the best way for UAV visual localization under Low-altitude Multi-view Observation Condition: a Benchmark

Yibin Ye, Xichao Teng, Shuo Chen, Leqi Liu, Kun Wang, Xiaokai Song, Zhang Li


170
RefDrone: A Challenging Benchmark for Referring Expression Comprehension in Drone Scenes

Zhichao Sun, Yepeng Liu, Zhiling Su, Huachao Zhu, Yuliang Gu, Yuda Zou, Zelong Liu, Gui-Song Xia, Bo Du, Yongchao Xu


171
Vision Language Models are Confused Tourists

Patrick Amadeus Irawan, Ikhlasul Akmal Hanif, Muhammad Dehan Al Kautsar, Genta Indra Winata, Fajri Koto, Alham Fikri Aji


172
LenghuSky-8: An 8-Year All-Sky Cloud Dataset with Star-Aware Masks and Alt-Az Calibration for Segmentation and Nowcasting

Yicheng Rui, Xiao-Wei Duan, Licai Deng, Fan Yang, Zhengming Dang, Zhengjun Du, Junhao Peng, Wenhao Chu, Umut Mahmut, Kexin Li, Yiyun Wu, Fabo Feng


173
Through the PRISM: Principle-Aware, Interpretable, and Multi-Scale Evaluation of Visual Designs

Mona Gandhi, K.J. Joseph, Srinivasan Parthasarathy, Sayan Nag


174
AEGIS: Exploring the Limit of World Knowledge Capabilities for Unified Multimodal Models

Jintao Lin, Bowen Dong, Weikang Shi, Chenyang Lei, Suiyun Zhang, Rui Liu, Xihui Liu


175
Name That Part: 3D Part Segmentation and Naming

Soumava Paul, Prakhar Kaushik, Ankit Vaidya, Anand Bhattad, Alan Yuille


177
Memorization in 3D Shape Generation: An Empirical Study

Shu Pu, Boya Zeng, Kaichen Zhou, Mengyu Wang, Zhuang Liu


178
Shape and Texture Recognition in Large Vision-Language Models

Sagi Eppel, Mor Bismut, Alona Strugatski


180
UDVideoQA: A Traffic Video Question Answering Dataset for Multi-Object Spatio-Temporal Reasoning in Urban Dynamics

Joseph Raj Vishal, Nagasiri Poluri, Katha Naik, Rutuja Patil, Kashyap Hegde Kota, Krishna Vinod, Prithvi Jai Ramesh, Mohammad Farhadi, Yezhou Yang, Bharatesh Chakravarthi


181
GOVTrack: Towards Generative Open-Vocabulary Multi-Object Tracking

Zekun Qian, Ruize Han, Zhixiang Wang, Liang Wan, Wei Feng


182
Towards Text-Guided Attribute-Disentangled Multimodal Representation Learning

Yibing Wei, Sudeep Katakol, Manuel Brack, Jinhong Lin, Haoyue Bai, Yu-Teng Li, Richard Zhang, Eli Shechtman, Hareesh Ravi, Ajinkya Kale


183
The DeepSpeak Dataset

Sarah Barrington, Maty Bohacek, Hany Farid


184
AndroidLens: Long-latency Evaluation with Nested Sub-targets for Android GUI Agents

Yue Cao, Yingyao Wang, Pi Bu, Jingxuan Xing, Wei Jiang, Zekun Zhu, Junpeng Ma, Sashuai Zhou, Tong Lu, Jun Song, Yu Cheng, Yuning Jiang, Bo Zheng


185
A2Z-10M+: Geometric Deep Learning with A-to-Z BRep Annotations for AI-Assisted CAD Modeling and Reverse Engineering

Pritham K Jena, Bhavika Baburaj, Tushar Anand, Vedant Dutta, Vineeth Ulavala, Sk Aziz Ali


186
MolRecBench-Wild: A Real-World Benchmark for Optical Chemical Structure Recognition

Haote Yang, Hui Wang, Chen Zhu, Jingchao Wang, Linye Li, Hongbin Lai, Huijie Ao, Yongxuan Lv, Jiang Wu, Jiaxing Sun, Lua Chen, Yuanyuan Cao, Ruijie Zhang, Shengxin Lu, Lijun Wu, Bin Wang, Conghui He


188
THEval. Evaluation Framework for Talking Head Video Generation

Nabyl Quignon, Baptiste Chopin, Yaohui Wang, Antitza Dantcheva


189
PolyReal: A Benchmark for Real-World Polymer Science Workflows

Wanhao Liu, Weida Wang, Jiaqing Xie, Suorong Yang, Jue Wang, Benteng Chen, Guangtao Mei, Zonglin Yang, Shufei Zhang, Yuchun Mo, Lang Cheng, Jin Zeng, Houqiang Li, Wanli Ouyang, Yuqiang Li


190
OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models

Yuping Yan, Yuhan Xie, Yuanshuai Li, Yingchao Yu, Lingjuan Lyu, Yaochu Jin


191
PureSpace: A Benchmark for Abstract Spatial Reasoning in Vision-Language Models

Jinkai Li, Zhenliang Zhang, Lifeng Fan, Wei Wang


192
Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models

Junbo Niu, Yuanhong Zheng, Ziyang Miao, Hejun Dong, Chunjiang Ge, Hao Liang, Ma Lu, Bohan Zeng, Qiahao Zheng, Conghui He, Wentao Zhang


193
Beyond 3D Geometry: M3FD, a Large-Scale Dataset and Benchmark for Multimodal 3D Perceptual Understanding

Huan Hu, Ping Chen, Zezhou Chen, Zhaoxiang Liu, Zipeng Wang, Xiang Liu, Xin Wang, Kai Wang, Shiguo Lian


195
WildRelight: A Real-World Dataset and Benchmark for Single-Image Relighting

Lezhong Wang, Mehmet Onurcan Kaya, Siavash Arjomand Bigdeli, Jeppe Revall Frisvad


196
EgoTL: Egocentric Think-Aloud Chains for Long-Horizon Tasks

Lulin Liu, Dayou Li, Yiqing Liang, Sicong Jiang, Hitesh Vijay, Hezhen Hu, Xuhai Xu, Zirui Liu, Srinivas Shakkottai, Manling Li, Zhiwen Fan


198
When Harmful Content Goes Invisible: Unveiling Perception Failure of LVLMs with CAMOUHARMTI

Yanhui Li, Qi Zhou, Zhihong Xu, Huizhong Guo, Wenhai Wang, Dongxia Wang


199
Step-CoT: Stepwise Visual Chain-of-Thought for Medical Visual Question Answering

Lin Fan, Yafei Ou, Zhipeng Deng, Pengyu Dai, Chongxian Hou, Jiale Yan, Yaqian Li, Kaiwen Long, Xun Gong, Masayuki Ikebe, Yefeng Zheng


200
Real-IAD MVN: A Multi-View Normal Vector Dataset and Benchmark for High-Fidelity Industrial Anomaly Detection

Wenbing Zhu, Jianing Liang, Linjie Cheng, Yurui Pan, Zhuhao Chen, Qingwang Yan, Yudong Cheng, Jianghui Zhang, Mingmin Chi, Bo Peng


202
Unifying Scientific Communication: Fine-Grained Correspondence Across Scientific Media

Megha Mariam K.M, Vineeth N. Balasubramanian, C.V. Jawahar


204
Safe-LLaVA: A Privacy-Preserving Vision Language Dataset and Benchmark for Biometric Safety

Younggun Kim, Sirnam Swetha, Fazil Kagdi, Mubarak Shah


205
DR-DPO: Dual-Regularized DPO for Efficient Dataset Condensation

Haiduo Huang, Jiangcheng Song, Yadong Zhang, Guansu Wang, Pengju Ren


207
SciPostGen: Bridging the Gap between Scientific Papers and Poster Layouts

Shun Inadumi, Shohei Tanaka, Tosho Hirasawa, Atsushi Hashimoto, Koichiro Yoshino, Yoshitaka Ushiku


208
Some Modalities are More Equal Than Others: Decoding and Architecting Multimodal Integration in MLLMs

Tianle Chen, Chaitanya Chakka, Arjun Reddy Akula, Xavier Thomas, Deepti Ghadiyaram


209
Towards Reliable Human Evaluations in Gesture Generation: Insights from a Community-Driven State-of-the-Art Benchmark

Rajmund Nagy, Hendric Voss, Thanh Hoang-Minh, Mihail Tsakov, Teodor Nikolov, Zeyi Zhang, Tenglong Ao, Sicheng Yang, Shaoli Huang, Yongkang Cheng, M. Hamza Mughal, Rishabh Dabral, Kiran Chhatre, Christian Theobalt, Libin Liu, Stefan Kopp, Rachel McDonnell, Michael Neff, Taras Kucherenko, Youngwoo Yoon, Gustav Eje Henter


210
SuperGlasses: Benchmarking Vision Language Models as Intelligent Agents for AI Smart Glasses

Zhuohang Jiang, Xu Yuan, Haohao Qu, Shanru Lin, Kanglong Liu, Wenqi Fan, Li Qing


211
InEdit-Bench: Benchmarking Intermediate Logical Pathways for Intelligent Image Editing Models

Zhiqiang Sheng, Xumeng Han, Zhiwei Zhang, Zenghui Xiong, Yifan Ding, Aoxiang Ping, Xiang Li, Tong Guo, Yao Mao


212
VEBench: Benchmarking Large Multimodal Models for Real-world Video Editing

Andong Deng, Dawei Du, Zhenfang Chen, Wen Zhong, Fan Chen, Guang Chen, Chia-Wen Kuo, Longyin Wen, Chen Chen, Sijie Zhu


215
From Static Snapshots to Dynamic Trajectories: Evaluating and Enhancing the Learning Pathways of Multimodal Large Language Models

Yukang Feng, Wenxiao Wu, Jianwen Sun, Chuanhao Li, Fanrui Zhang, Zizhen Li, Jiaxin Ai, Sizhuo Zhou, Yifan Chang, Changxin Gao, Shenglin Zhang, Kaipeng Zhang


216
Evaluating Dataset Watermarking for Fine-Tuning Traceability of Customized Diffusion Models: A Comprehensive Benchmark and Removal Approach

Xincheng Wang, Hanchi Sun, Wenjun Sun, Kejun Xue, Wangqiu Zhou, Jianbo Zhang, Wei Sun, Dandan Zhu, Xiongkuo Min, Jun Jia, Zhijun Fang


217
BMD-45: A Large-Scale CCTV Vehicle Detection Dataset for Urban Traffic in Developing Cities

Akash Sharma, Chinmay Mhatre, Sankalp Gawali, Ruthvik Bokkasam, Brij Sharma, Vishwajeet Pattanaik, Punit Rathore, Raghu Krishnapuram, Vijay Gopal Kovvali, Anirban Chakraborty, Yogesh Simmhan


218
SciGA: A Comprehensive Dataset for Designing Graphical Abstracts in Academic Papers

Takuro Kawada, Shunsuke Kitada, Sota Nemoto, Hitoshi Iyatomi


219
Splatwizard: A Benchmark Toolkit for 3D Gaussian Splatting Compression

Xiang Liu, Yimin Zhou, Jinxiang Wang, Yujun Huang, Shuzhao Xie, Shiyu Qin, Mingyao Hong, Jiawei Li, Yaowei Wang, Zhi Wang, Shu-Tao Xia, Bin Chen


220
See, Hear, and Understand: Benchmarking Audiovisual Human Speech Understanding in Multimodal Large Language Models

Le Thien Phuc Nguyen, Zhuoran Yu, Samuel Low Yu Hang, Subin An, Jeongik Lee, Yohan Ban, SeungEun Chung, Thanh-Huy Nguyen, JuWan Maeng, Soochahn Lee, Yong Jae Lee


222
CATS-V2V: A Real-World Vehicle-to-Vehicle Cooperative Perception Dataset with Complex Adverse Traffic Scenarios

Hangyu Li, Bofeng Cao, Zhaohui Liang, Wuzhen Li, Juyoung Oh, Yuxuan Chen, Shixiao Liang, Hang Zhou, Chengyuan Ma, Jiaxi Liu, Zheng Li, Peng Zhang, Keke Long, Maolin Liu, Jackson Jiang, Chunlei Yu, Shengxiang Liu, Hongkai Yu, Xiaopeng Li


223
Seeing the Abstract: A Benchmark for Visual-Only Metaphor Understanding in Multimodal Large Language Models

Shan Zhao, Zhao Yang, Tianwei Yan, Yusong Gong, Qian Wan, Shizhao Chen, Shezheng Song, Chengyu Wang, Meng Wang


224
Cross-Dimensional Forgery Pattern Extraction for Generalizable Forgery Localization Framework

Yilin Wang, Dawei Luo, Shuai Chen, Feng Xu, Jiachi Wang, Zunlei Feng, Yijun Bei


226
SPOT: Sparsification with Attention Dynamics via Token Relevance in Vision Transformers

Oded Schlesinger, Amirhossein Farzam, J. Matias Di Martino, Guillermo Sapiro


227
Do LLMs and VLMs Share Reasoning Neurons? Evidence and Mechanisms of Cross-Modal Transfer

Chenhang Cui, An Zhang, Yuxin Chen, Gelei Deng, Jingnan Zheng, Zhenkai Liang, Xiang Wang, Tat-Seng Chua


228
Debiased One-Shot NAS Via Density-Aware Sampling

Mehraveh Javan Roshtkhari, Matthew Toews, Marco Pedersoli


229
PSLIF: A Primary-Supplementary LIF Neuron for Spiking Neural Networks

Jie Guo, JunXiang Wu, Nan An, Zhen Zhang, Shuiying Xiang, Mingjin Zhang, Yunsong Li, Yu'e Gao


230
SHIELD: Secure Hypernetworks for Incremental Expansion Learning Defense

Patryk Krukowski, Łukasz Gorczyca, Piotr Helm, Kamil Książek, Przemysław Spurek


231
Eigen-Value: Efficient Domain-Robust Data Valuation Via Eigenvalue-Based Approach

Youngjun Choi, Joonseong Kang, Sungjun Lim, Kyungwoo Song


235
Any-Class Presence Likelihood for Robust Multi-Label Classification with Abundant Negative Data

Dumindu Tissera, Omar Awadallah, Muhammad Umair Danish, Ayan Sadhu, Katarina Grolinger


236
VideoMatGen: PBR Materials through Joint Generative Modeling

Jon Hasselgren, Miloš Hašan, Zheng Zeng, Jacob Munkberg


237
TransKV: A Data-Driven Pruning Method for Large Foundation Models

Guangning Xu, Fanxu Meng, Ruijie Zhou, Michael K Ng, Wenjie Pei, Muhan Zhang


238
Rich Feature Learning via Diversification

Xi Leng, Yongqiang Chen, Xiaoying Tang, Yatao Bian


240
Dual Strategies for Test-Time Adaptation

Nam Nguyen Phuong, Duc Nguyen The Minh, Phi Le Nguyen, Ehsan Abbasnejad, Minh Hoai


241
CPUBone: Efficient Vision Backbone Design for Devices with Low Parallelization Capabilities

Moritz Nottebaum, Matteo Dunnhofer, Christian Micheloni


242
FLToM: Robust Federated Learning with Theory-of-Mind Structure

Tianshu Xiao, Liu Yang, Sichang Guo, Qilong Wang, Qinghua Hu


243
FedCVC: Federated Primal-Dual Learning with Client-Driven Virtual Compensation for Mitigating Dual Drift

Jinshan Lai, Tingxuan Huang, Baoyang Jiang, Liuyu Xiang, Qiang Ma, Jianwei Hu


244
Q-MambaIR: Accurate Quantized Mamba for Efficient Image Restoration

Yujie Chen, Haotong Qin, Zhang Zhang, Michele Magno, Luca Benini, Yawei Li


246
PoM: A Linear-Time Replacement for Attention with the Polynomial Mixer

David Picard, Nicolas Dufour, Lucas Degeorge, Arijit Ghosh, Davide Allegro, Tom Ravaud, Yohann Perron, Corentin Sautier, Zeynep Sonat Baltaci, Fei Meng, Syrine Kalleli, Marta López-Rauhut, Thibaut Loiseau, Ségolène Albouy, Raphael Baena, Elliot Vincent, Loic Landrieu


248
Deep Feedback ConvNets by Embedding the Working Memory Module for Image Classification

Lulu Fang, Jiaxiang Qin, Ruiheng Yan, Ning Pan, Haihua Liu, Xinxin Chen


249
Channel Correlation Loss for Binary Neural Networks

Xindi Zuo, Wei Zhang, Hai Yu, Zhiliang Zhu


250
MegAD: An Expert in Meta-Learning Guided Few-Shot Anomaly Detection

Xinying Li, Junfeng Jing, Tong Wu, Tian Gao, Zhihong Sheng


252
From Drops to Grid: Noise-Aware Spatio-Temporal Neural Process for Rainfall Estimation

Rafael Pablos Sarabia, Joachim Nyborg, Morten Birk, Ira Assent


253
AdaPerceiver: Transformers with Adaptive Width, Depth, and Tokens

Purvish Jajal, Nicholas John Eliopoulos, Benjamin Shiue-Hal Chou, George K Thiruvathukal, Yung-Hsiang Lu, James C. Davis


255
Res2SPDNet: Multi-Granularity SPD Matrix Residual Learning for Signal Classification

Shenghui Yue, Rui Wang, Tianyang Xu, Tao Zhou, Xiao-Jun Wu, Josef Kittler


256
From Navigation to Refinement: Revealing the Two-Stage Nature of Flow-based Diffusion Models through Oracle Velocity

Haoming Liu, Jinnuo Liu, Yanhao Li, Liuyang Bai, Yunkai Ji, Yuanhe Guo, Shenji Wan, Hongyi Wen


258
Spectral-Aware Adaptive Convolution for Fine-Grained Cross-View Visual Localization

Linsi Wu, Gang Shen, Xuefei Lv, Chenglong Wu, Yuru Pei


259
Context-Aware Semantic Segmentation via Stage-Wise Attention

Antoine Carreaud, Elias Naha, Arthur Chansel, Nina Lahellec, Jan Skaloud, Adrien Gressin


261
AlphaMerging: Orthogonal Subspace Projection of Task Vectors to Reduce Task Interference for Multi-Task Model Merging

Zuchi Bazarvaani, Seung-Ho Lee, Jeongmin Ahn, Donghyeon Jeon, Inho Kang, Seung-Hoon Na


263
Hi3Doc: Hierarchical Tri-Level Representations for Multimodal Long-Document Understanding

Wanying Zhou, Zhuo Chen, Jianzhi Lu, Chenxi Ma, Weimin Tan, Bo Yan


264
LongDocSpan: Extending LVLMs for Long Document Understanding

Junwei Liu, Xiong Wang, Junchao Wu, Yefeng Liu, Congyun Jin, Jiangwei Lao, Junjie Wang, Derek F. Wong, Zhihong Lu, Jian Wang, Ping Wang


265
M-DocSum: Do LVLMs Genuinely Comprehend Interleaved Image-Text in Document Summarization?

Haolong Yan, Kaijun Tan, Yeqing Shen, Xin Huang, Jia Wang, Zheng Ge, Xiangyu Zhang, Si Li, Daxin Jiang


266
InstructTable: Improving Table Structure Recognition Through Instruction

Boming Chen, Zining Wang, Zhentao Guo, Jianqiang Liu, Chen Duan, Yu Gu, Kai zhou, Pengfei Yan


267
SciPostLayoutTree: A Dataset for Structural Analysis of Scientific Posters

Shohei Tanaka, Atsushi Hashimoto, Yoshitaka Ushiku


268
Efficient Document Parsing via Parallel Token Prediction

Lei Li, Ze Zhao, Meng Li, Zhongwang Lun, Yi Yuan, Xingjing Lu, Zheng Wei, Jiang Bian, Zang Li


269
ChartAgent: A Chart Understanding Framework with Tool Integrated Reasoning

Boran Wang, Xinming Wang, Yi Chen, Xiang Li, Jian Xu, Jing Yuan, Cheng-Lin Liu


270
RedVTP: Training-Free Acceleration of Diffusion Vision-Language Models Inference via Masked Token-Guided Visual Token Pruning

Jingqi Xu, Jingxi Lu, Chenghao Li, Sreetama Sarkar, Souvik Kundu, Peter A Beerel


271
FREE-Switch: Frequency-Based Dynamic LoRA Switch for Style Transfer

Shenghe Zheng, Minyu Zhang, Tianhao Liu, Hongzhi Wang


272
FedVG: Gradient-Guided Aggregation for Enhanced Federated Learning

Alina Devkota, Jacob Thrasher, Donald Adjeroh, Binod Bhattarai, Prashnna k. Gyawali


275
GM-Skip: Metric-Guided Transformer Block Skipping for Efficient Vision-Language Models

Lianming Huang, Haibo Hu, Qiao Li, Xin He, Nan Guan, Chun Jason Xue


276
Dyna-ViT: Parameter-Free Pre-Encoder Token Pruning for Efficient Vision Transformers

Syeda Fiza Rubab, Arslan Abdul Ghaffar, Malik Junaid Jami Gul, Sheriff Murtala, Ingyu Lee, Gyu Sang Choi


277
Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention

Wenhu Zhang, Yiming Wu, Huanyu Wang, YaoYang Liu, Huanzhang Dou, Senqiao Yang, Sitong Wu, Hanbin Zhao, Jiaya Jia


278
MaMe: Matrix-Based Token Merging

Simin Huo, Ning Li


279
Tiny Inference-Time Scaling with Latent Verifiers

Davide Bucciarelli, Evelyn Turri, Lorenzo Baraldi, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara


280
DaMN: Deleting and Migrating Normalization Layers from Transformers

Alexey Ryabykin, Irina Zhelavskaya, Egor Shvetsov, Alexey Rukhovich, Nikita Okhotnikov, Artem Khrapov, Evgeny Burnaev, Vladimir Mikhailovich Kryzhanovskiy


281
Enriching Knowledge Distillation with Cross-Modal Teacher Fusion

Amir M. Mansourian, Amir Mohammad Babaei, Shohreh Kasaei


282
UNIFORM: Unifying Knowledge from Large-scale and Diverse Pre-trained Models

Yimu Wang, Weiming Zhuang, Chen Chen, Jiabo Huang, Jingtao Li, Lingjuan Lyu


283
ProGIC: Progressive and Lightweight Generative Image Compression with Residual Vector Quantization

Hao Cao, Chengbin Liang, Wenqi Guo, Zhijin Qin, Jungong Han


285
Mix-to-Max: Optimizing Data Mixtures for Peak Vision-Language Efficiency

Erwei Zhao, Haijin Zeng, Weiwei Xiao, Shijie Cao, Qiben Shan, Shaocong Wu, Jingyong Su, Jie Liu


286
INTERLACE: Interleaved Layer Pruning and Efficient Adaptation in Large Vision-Language Models

Parsa Madinei, Ryan Solgi, Ziqi Wen, Jonathan Skaza, Miguel Eckstein, Ramtin Pedarsani


287
JetViT: Efficient High-Resolution Vision Transformer with Post-Training Attention Search

Dongyun Zou, Zhuoyang Zhang, Junyu Chen, Wenkun He, Qinhe Peng, Hanrong Ye, Yao Lu, Hongxu Yin, Yu Wang, Song Han, Han Cai


288
SLAD : Shared LoRA Adapters for Task Specific Distillation

Reda Bensaid, Yassir Bendou, Vincent Gripon, François Leduc-Primeau


289
D4C: Data-Free Quantization for Contrastive Language-Image Pre-Training Models

Wenlun Zhang, Yunshan Zhong, Zihao Ding, Xinyu Li, Kentaro Yoshioka


290
ELSA: Exact Linear-Scan Attention for Fast and Memory-Light Vision Transformers

Chih-Chung Hsu, Xin-Di Ma, Wo-Ting Liao, Chia-Ming Lee


291
MPM: Mutual Pair Merging for Efficient Vision Transformers

Simon Ravé, Pejman Rasti, David Rousseau


292
Generalized Neighborhood Attention: Multi-dimensional Sparse Attention at the Speed of Light

Ali Hassani, Fengzhe Zhou, Aditya Kane, Jiannan Huang, Chieh-Yun Chen, Min Shi, Steven Walton, Markus Hoehnerbach, Vijay Thakkar, Mikhail Isaev, Qinsheng Zhang, Bing Xu, Haicheng Wu, Wen-mei Hwu, Ming-Yu Liu, Humphrey Shi


293
AlignFL: Adaptive Learning and Intelligent Generation of Networks for Federated Learning

Qilin Xiang, Qilin Fan, Xinrui Li, Tianfu Wang, Shuting Qiu, Yue Niu


294
Beyond Loss Values: Robust Dynamic Pruning via Loss Trajectory Alignment

Huaiyuan Qin, Muli Yang, Gabriel James Goenawan, Kai Wang, Zheng Wang, Peng Hu, Xi Peng, Hongyuan Zhu


296
Beyond Accuracy: An Empirical Study of Perception Stability in Multimodal Large Language Models

Feng Chen, Chenhui Gou, Yefei He, Yang Yang, Bohan Zhuang, Qi Wu


297
Event-VStream: Event-Driven Real-Time Understanding for Long Video Streams

Zhenghui Guo, Yuanbin Man, Junyuan Sheng, Bowen Lin, Ahmed Ahmed, Bo Jiang, Boyuan Zhang, Miao Yin, Sian Jin, Omprakash Gnawali, Chengming Zhang


298
M^3A Policy: Mutable Material Manipulation Augmentation Policy through Photometric Re-rendering

Jiayi Li, Yuxuan Hu, Haoran Geng, Xiangyu Chen, Chuhao Zhou, Ziteng Cui, Jianfei Yang


299
AOMGen: Photoreal, Physics-Consistent Demonstration Generation for Articulated Object Manipulation

Yulu Wu, Jiujun Cheng, Haowen Wang, Dengyang Suo, Pei Ren, Qichao Mao, Shangce Gao, Yakun Huang


300
Environmental Understanding Vision-language Model for Embodied Agent

Jinsik Bang, Jaeyeon Bae, Donggyu Lee, Siyeol Jung, Taehwan Kim


301
DEGround: An Effective Baseline for Ego-centric 3D Visual Grounding With a Homogeneous Framework

Yani Zhang, Dongming Wu, Hao Shi, Yingfei Liu, Tiancai Wang, Xingping Dong


302
Prune-Then-Plan: Step-Level Calibration for Stable Frontier Exploration in Embodied Question Answering

Noah Frahm, Prakrut Patel, Yue Zhang, Shoubin Yu, Mohit Bansal, Roni Sengupta


303
Think Twice, Act Once: Verifier-Guided Action Selection For Embodied Agents

Nishad Singhi, Christian Bialas, Snehal Jauhri, Vignesh Prasad, Georgia Chalvatzaki, Marcus Rohrbach, Anna Rohrbach


304
Plug-and-Think: Structured Reasoning for Vision–Language–Action Models

Kaikai Wei, Di wen, Xinhai Li, Senwei Xiang


305
World Model Robustness via Surprise Recognition

Geigh Zollicoffer, Tanush Chopra, Mingkuan Yan, Xiaoxu Ma, Kenneth Eaton, Mark Riedl


306
PlanGS: Active 3D Gaussian Reconstruction with Real-Time Planning

Wenxiang Xie, Anpei Chen, Haoming Yu, Yujun Shen, Weiwei Xu


307
A Simple Framework for Visual Navigation

Faith Johnson, Bryan Bo Cao, Shubham Jain, Ashwin Ashok, Kristin Dana


308
Event-Based Optical Flow Leveraging Precise Event Timing

Hugh Greatorex, Elisabetta Chicca


309
Generative Event Pretraining with Foundation Model Alignment

Jianwen Cao, Jiaxu Xing, Nico Messikommer, Davide Scaramuzza


310
HelixTrack: Event‑Based Tracking and RPM Estimation of Propeller-like Objects

Radim Spetlik, Michal Pliska, Vojtěch Vrba, Jiří Matas


311
PEPR: Privileged Event-based Predictive Regularization for Domain Generalization

Gabriele Magrini, Federico Becattini, Niccolò Biondi, Pietro Pala


312
Unleashing the Potential of Event-Based Stereo Via Coarse-to-Fine Bio-Inspired Regression

Haihao Zhang, Siwei Dong, Jianing Li, Rui Zhao, Yunjian Zhang, Geng Qin, Lin Zhu


313
Metric-Guided Feature Fusion of Visual Foundation Models for Segmentation Tasks

Yachan Guo, Jose Lu Gómez, Danna Xue, Yi Xiao, Antonio M. López


314
An Interpretable Alzheimer's Disease Diagnosis Model via Gray Matter Attention Guided Counterfactual Reasoning

Pengzhou Chen, Qiling Tang, XinYu Chai, Rong Liu, Zhi Li, Liman Liu


316
CLIP-Free, Label Free, Unsupervised Concept Bottleneck Models

Fawaz Sammani, Jonas Fischer, Nikos Deligiannis