Findings Poster Session
Findings Poster Session 1
BLMT-Stereo: Breaking the Local Minima Trap of Iterative Stereo Matching
Zhien Dai, Zhaohui Tang, Hu Zhang, Mingjun Pan, Jin Luo, Yongfang Xie
SwiftNDC: Fast Neural Depth Correction for High-Fidelity 3D Reconstruction
Kang Han, Wei Xiang, Lu Yu, Mathew Wyatt, Gaowen Liu, Ramana Rao Kompella
ProDiG: Progressive Diffusion-Guided Gaussian Splatting for Aerial to Ground Reconstruction
Sirshapan Mitra, Yogesh S Rawat
4D E-SloMo: 4D Reconstruction for High Speed Scene using a Hybrid RGB-Event Multi-View System
Bo Xu, Jun Dai, Yutian Chen, Linning Xu, Mulin Yu, Yujin Wang, Shi Guo, Xinyi Le, Tianfan Xue
MADrive: Memory-Augmented Driving Scene Modeling
Polina Karpikova, Daniil Selikhanovych, Kirill Struminsky, Ruslan Musaev, Maria Golitsyna, Dmitry Baranchuk
OnlineX: Unified Online 3D Reconstruction and Understanding with Active-to-Stable State Evolution
Chong Xia, Fangfu Liu, Yule Wang, Yize Pang, Yueqi Duan
SyncTrack4D: Cross-Video Motion Alignment and Video Synchronization with Multi-Video 4D Gaussian Splatting
Yonghan Lee, Tsung-Wei Huang, Shiv Gehlot, Jaehoon Choi, Guan-Ming Su, Dinesh Manocha
CLLAP: Contrastive Learning-based LiDAR-Augmented Pretraining for Enhanced Radar-Camera Fusion
Bingyi Liu, Chuanhui Zhu, Hongfei Xue, Jian Teng, Jipeng Liu, Enshu Wang, Penglin Dai, Pu Wang
Point2Gaussian: Point-Cloud-to-Gaussian Conversion for Efficient 3D Scene Rendering
Powei Liao, Jiro Abe, Kazumine Ogura
FF3R: Feedforward Feature 3D Reconstruction from Unconstrained views
Chaoyi Zhou, Run Wang, Feng Luo, Mert D. Pesé, Zhiwen Fan, Yiqi Zhong, Siyu Huang
HEDA: Hyperbolic-Euclidean Dual Adaptation for Robust Real-World Point Cloud Completion
Aihua Mao, Jun Yang, Yong-Jin Liu, Ying He
WildAni4D: Towards 4D Animal Mesh Reconstruction
Gyeongsu Cho, Hezhen Hu, Donghyeon Soon, Changwoo Kang, Kyungdon Joo
Dynamic Scene Decomposition Beyond Moving Objects for High-Fidelity 3D Reconstruction in Autonomous Driving
Mingbo Dai, Han Yan, Bolun Zhang, Wu Ran, Chao Ma
LangFlash: Feed-forward 3D Language Gaussian Splatting from Sparse Unposed Images
Yilong Liu, Wanhua Li, Chen Zhu-Tian, Hanspeter Pfister
FACT-GS: Frequency-Aligned Complexity-Aware Texture Reparameterization for 2D Gaussian Splatting
Tianhao Xie, Linlian Jiang, Xinxin Zuo, Yang Wang, Tiberiu Popa
Improving Densification in 3D Gaussian Splatting for High-Fidelity Rendering
Xiaobin Deng, Changyu Diao, Min Li, Ruohan Yu, Duanqing Xu
OpenTrack3D: Towards Accurate and Generalizable Open-Vocabulary 3D Instance Segmentation
Zhishan Zhou, Siyuan Wei, Zengran Wang, Chunjie Wang, Xiaosheng Yan, Xiao Liu
GeoFusion-CAD: Structure-Aware Diffusion with Geometric State Space for Parametric 3D Design
Xiaolei Zhou, Chuangjie Fang, Jie Wu, Jingyi Yang, Boyi Lin, Jianwei Zheng
SPIDER: Spatial Image CorresponDence Estimator for Robust Calibration
Zhimin Shao, Abhay Yadav, Rama Chellappa, Cheng Peng
GEAR: GEometry-Motion Alternating Refinement for Articulated Object Modeling with Gaussian Splatting
Jialin Li, Bin Fu, Ruiping Wang, Xilin Chen
GlowGS: Generative Semantic Feature Learning for 3D Gaussian Splatting in Nighttime Glow Scenes
Beibei Lin, Xiao Cao, Jingyuan Guo, Robby T. Tan
2D Triangle Splatting for Direct Differentiable Mesh Training
Kaifeng Sheng, Zheng Zhou, Yingliang Peng, Qianwei Wang
ForgeDreamer: Industrial Text-to-3D Generation with Multi-Expert LoRA and Cross-View Hypergraph
Junhao Cai, Deyu Zeng, Junhao Pang, Lini Li, Xiaopin Zhong, Zongze Wu
3D Gaussian Splatting for Annular Dark Field Scanning Transmission Electron Microscopy Tomography Reconstruction
Beiyuan Zhang, Hesong Li, Ruiwen Shao, Ying Fu
IDSplat: Instance-Decomposed 3D Gaussian Splatting for Driving Scenes
Carl Lindström, Mahan Rafidashti, Maryam Fatemi, Lars Hammarstrand, Martin R. Oswald, Lennart Svensson
Stream3D: Streaming Zero-Shot 3D Instance Segmentation with Multi-View Noise Mask Filtering and Manifold Refining
Jie Xu, Na Zhao
Active Exploration for Sparse Visual Localization
Johanna Lidholm, Ludvig Dillén, Zuzana Kukelova, Torsten Sattler, Viktor Larsson
GRVS: a Generalizable and Recurrent Approach to Monocular Dynamic View Synthesis
Thomas Tanay, Mohammed Brahimi, Michal Nazarczuk, Qingwen Zhang, Sibi Catley-Chandar, Arthur Moreau, Zhensong Zhang, Eduardo Pérez-Pellitero
3DFA: Aligning the Features Between Point Cloud and Query Image for Scene-Specific Visual Localization
Sizhe Song, Yankuan Chi, Shuhan Zhong, S.-H. Gary Chan
Long-LRM++: Preserving Fine Details in Feed-Forward Wide-Coverage Reconstruction
Chen Ziwen, Hao Tan, Peng Wang, Zexiang Xu, Li Fuxin
Native3D: End-to-End 3D Scene Generation via Unified Mesh-Texture Modeling and Semantic Alignment
Yibo Liu, Ziwei Zhang, Haozhou Pang, Menghao Li, Lanshan He, Gan Qi
From Orbit to Ground: Generative City Photogrammetry from Extreme Off-Nadir Satellite Images
Fei Yu, Yu Liu, Luyang Tang, Mingchao Sun, Zengye Ge, Rui Bu, Yuchao Jin, Haisen Zhao, He Sun, Yangyan Li, Mu Xu, Wenzheng Chen, Baoquan Chen
NeVStereo: A NeRF-Driven NVS-Stereo Architecture for High-Fidelity 3D Tasks
Pengcheng Chen, Yue Hu, Wenhao Li, Nicole M Gunderson, Andrew Feng, Zhenglong Sun, Peter Beerel, Eric J Seibel
VGGT4D: Mining Motion Cues in Visual Geometry Transformers for 4D Scene Reconstruction
Yu Hu, Chong Cheng, Sicheng Yu, Xiaoyang Guo, Hao Wang
AvatarMix: Identity-Preserving Cross-Avatar Composition for Outfit Personalization
Zhaorong Wang, Yoshihiro Kanamori, Yuki Endo
Object Pose Transformer: Unifying Unseen Object Pose Estimation
Weihang Li, Lorenzo Garattoni, Fabien Despinoy, Nassir Navab, Benjamin Busam
SwiftVGGT: A Scalable Visual Geometry Grounded Transformer for Large-Scale Scenes
Jungho Lee, Minhyeok Lee, Sunghun Yang, Minseok Kang, Sangyoun Lee
CATRF: Codec-Adaptive TriPlane Radiance Fields for Volumetric Content Delivery
Tung-I Chen, Lingdong Wang, Subhransu Maji, Ramesh K. Sitaraman
PDF-GS: Progressive Distractor Filtering for Robust 3D Gaussian Splatting
Kangmin Seo, MinKyu Lee, Tae-Young Kim, ByeongCheol Lee, JoonSeoung An, Jae-Pil Heo
Three-Step Conditional Diffusion 3D Reconstruction for Light-Field Microscopy
Qihong Zhao, Shaokang Yan, Zhimin Qiao, Jinjia Wang, Bo Xiong
LTGS: Long-Term Gaussian Scene Chronology From Sparse View Updates
Minkwan Kim, Seungmin Lee, Junho Kim, Young Min Kim
Softmax-GS: Generalized Gaussians Learning When to Blend or Bound
Chen Ziwen, Peng Wang, Hao Tan, Zexiang Xu, Li Fuxin
G2I: Transitioning a Generalized Monocular Depth Estimation Model to In-Domain Metric Depth Prediction
Chao Ning, Naoto Yokoya
3D-RE-GEN: 3D Reconstruction of Indoor Scenes with a Generative Framework
Tobias Sautter, Jan-Niklas Dihlmann, Hendrik P A Lensch
HiDiGen: Hierarchical Diffusion for B-Rep Generation with Explicit Topological Constraints
Shurui Liu, Weide Chen, Ancong Wu
RiGS: Rigid-aware 4D Gaussian Splatting from a Single Monocular Video
Chenyu Wu, Wanhua Li, Chen Zhu-Tian, Hanspeter Pfister
RAD: Retrieval-Augmented Monocular Metric Depth Estimation for Underrepresented Classes
Michael Baltaxe, Dan Levi, Sagie Benaim
WGS: Watertight Geometry Standardization for Scalable 3D Generation
Dehao Hao, Tanghui Jia, Kaiyi Zhang, Weikai Chen, Zeyu Hu, Yingda Yin, Runze Zhang, Lingting Zhu, Li Yuan, Xin Wang, Long Quan
Self-Evolving 3D Scene Generation from a Single Image
Kaizhi Zheng, Yue Fan, Jing Gu, Zishuo Xu, Xuehai He, Xin Eric Wang
Distill Any Depth: Distillation Creates a Stronger Monocular Depth Estimator
Xiankang He, Dongyan Guo, Hongji Li, Ying Cui, Libo Weng, Ruibo Li, Chi Zhang
Re-Depth Anything: Test-Time Depth Refinement via Self-Supervised Re-lighting
Ananta R. Bhattarai, Helge Rhodin
UniVerse3D: Emerging Properties of Unified Multimodal Models in 3D Understanding and Generation
Junliang Ye, Zehuan Huang, Yansong Qu, Chunshi Wang, Yunhan Yang, Yang Li, Yawei Luo, Zhuo Chen, Sheng Lu, Jun Zhu, Chunchao Guo
HumanOrbit: 3D Human Reconstruction as 360° Orbit Generation
Keito Suzuki, Kunyao Chen, Lei Wang, Bang Du, Runfa Blark Li, Peng Liu, Ning Bi, Truong Nguyen
Beyond Voxel 3D Editing : Learning from 3D Masks and Self-Constructed Data
Yizhao Xu, Hongyuan Zhu, Caiyun Liu, Tianfu Wang, Keyu Chen, Sicheng Xu, Jiaolong Yang, Nicholas jing Yuan, Qi Zhang
Adversarial Agents: Black-Box Evasion Attacks with Reinforcement Learning
Kyle Domico, Jean-Charles Noirot Ferrand, Ryan Sheatsley, Eric Pauley, Josiah Hanna, Patrick McDaniel
Defending CLIP via Noise-Induced Feature Dynamics for Training-Free, Zero-shot Adversarial Robustness
Debarshi Brahma, Soma Biswas
Jailbreaking Frontier Foundation Models Through Intention Deception
Xinhe Wang, Katia Sycara, Yaqi Xie
NSGuard: Null-Space Guided Robust Watermarking for Data Copyright Protection in Customized Generation
Lizhi Xiong, Jianguo Feng, Ziqiang Li, Jun Li, Weiwei Jiang, Zhangjie Fu
A Robust Out-of-Distribution Detection Framework via Synergistic Smoothing
Maria Stoica, Abdelrahman Hekal, Alessio Lomuscio
BadRSSD: Backdoor Attacks on Regularized Self-Supervised Diffusion Models
Jiayao Wang, Yiping Zhang, Mohammad Maruf Hasan, Xiaoying Lei, Jiale Zhang, Junwu Zhu, Qilin Wu, Dongfang Zhao
CLIP-Inspector: Model-Level Backdoor Detection for Prompt-Tuned CLIP via OOD Trigger Inversion
Akshit Jindal, Saket Anand, Chetan Arora, Vikram Goyal
BadVLM: Towards Efficient and Resilient Backdoor Attacks on Large Vision-Language Models
Ba Luan Dang, Vu Tuan Truong, Long Bao Le
Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models
Songlong Xing, Weijie Wang, Zhengyu Zhao, Jindong Gu, Philip Torr, Nicu Sebe
Breaking the Illusion: Consensus-Based Generative Mitigation of Adversarial Illusions in Multi-Modal Embeddings
Fatemeh Akbarian, Anahita Baninajjar, Yingyi Zhang, Ananth Balashankar, Amir Aminifar
When Data is Scarce, Learn to Adapt: Robust Federated Learning via Adversarial Meta-Optimization
Md Zarif Hossain, Awal Ahmed Fime, Ahmed Imteaj
Robust Alignment: Harmonizing Clean Accuracy and Adversarial Robustness in Adversarial Training
Yanyun Wang, Qingqing Ye, Li Liu, Zi Liang, Haibo Hu
DRA: Structure-Preserving Backdoor Erasure via Diagnosing, Recalibrating, and Adapting
Minwei Wen, Yang Wei, Junhao Xiao, Xiuli Bi, Bin Xiao
APC: Transferable and Efficient Adversarial Point Counterattack for Robust 3D Point Cloud Recognition
Geunyoung Jung, Soohong Kim, Inseok Kong, Jiyoung Jung
Cognitive Attack Detection in Augmented Reality (CADAR): A Neuro-Symbolic Approach with Particle Filtering on Perception Graphs
Rongqian chen, Allison Andreyev, Yanming Xiu, Joshua Chilukuri, Shunav Sen, Mahdi Imani, Bin Li, Maria Gorlatova, Gang Tan, Tian Lan
On Evaluating Stateful Defence Models against Query-Based Black-Box Attacks
Ziad Tariq Muhammad Ali, Raja Muhammad Atif Azad, Muhammad Ajmal Azad, Iain Rice, Umar Daraz, Ali Shariq Imran, James Holyhead
Optimizing Certified Radius of Zero-shot Composed Image Retrieval via Text Guidance
Junyang Chen, Haomin Ni, Hanjiang Lai
When Interpretability Becomes a Liability: Adversarial Attacks on CBM Concept Layers
Aditya Sridhar
Red-teaming the Multimodal Reasoning: Jailbreaking Vision-Language Models via Cross-modal Entanglement Attacks
Yu Yan, Sheng Sun, Shengjia Cheng, Teli Liu, Mingfeng Li, Min Liu
Phantom: A Unified Face-Swap Deepfake Protection Framework with Latent and Spatial Constraints
Jungkon Kim, Cheolseung Jung, Jong-Min Choi, Juseong Lee
Tap, Scan, Exploit: The Hidden Vulnerabilities of Everyday QR Codes
Ashish Kumar, Aarthi S, Akshay Agarwal
DeepFakeShield: A Proactive Defense Against Malicious Face Swapping
Saeed Karimi-Bidhendi, Joseph DeGol, Eric Wengrowski, Dominic Roberts, Kristin Dana
MDG: Masked Denoising Generation for Multi-Agent Behavior Modeling in Traffic Environments
Zhiyu Huang, Zewei Zhou, Tianhui Cai, Yun Zhang, Jiaqi Ma
LiDAR-to-4D Radar Synthesis for Building Large-Scale Tensor Datasets
Woo-Jin Jung, Dong-Hee Paek, Seung-Hyun Kong
SurfaceGS: Dynamic Surface Gaussian Splatting for Urban Driving Scenes
Fudong Ge, Dingning Liu, Hanshi Wang, Yiwei Zhang, Jin Gao, Weiming Hu, Zhipeng Zhang
JACoP: Joint Alignment for Compliant Multi-Agent Prediction
Qingze Tony Liu, Alen Mrdovic, Danrui Li, Mathew Schwartz, Sejong Yoon, Mubbasir Kapadia
Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving
Zhexi Lian, Haoran Wang, Xuerun Yan, Weimeng Lin, Xianhong Zhang, Yongyu Chen, Jia Hu
What Matters for Scalable and Robust Learning in End-to-End Driving Planners?
David Holtz, Niklas Hanselmann, Simon Doll, Marius Cordts, Bernt Schiele
Physics-Informed Reward Framework for Vision-Language Driven Safe Autonomous Driving
Xuepei Yang, Mingtao Feng, Weisheng Dong, Lin Chen, Jie Feng, Fangfang Wu, Yufan Zhu, Ajmal Saeed Mian
HorizonWeaver: Generalizable Multi-Level Semantic Editing for Driving Scenes
Mauricio Soroco, Francesco Pittaluga, Zaid Tasneem, Abhishek Aich, Bingbing Zhuang, Wuyang Chen, Manmohan Chandraker, Ziyu Jiang
VESPA: Open-World Auto-Labeling for 3D Object Detection in Autonomous Driving
Levente Tempfli, Esteban Rivera, Markus Lienkamp
IRL-VLA: Vision-Language-Action Training via Reward World Model
Anqing Jiang, Gao Yu, Heng Yuwen, Yiru Wang, Wang Shuo, Jiang Hao, Sun Hao
KnowMTP: A Knowledge-Guided Framework for Multi-Agent Trajectory Prediction in Autonomous Driving
Rufan Bai, Tianyi Xue, Tiantian Zhou, Weiwei Wu, Changle Li, Yuhuan Lu
MapGPT: A Vision-Language Model for Large-Scale High-Definition Map Generation
Mengxi Wu, Long Zhou, Zhixia Li, Adrian Kwan, Denis Laprise, Hengyi Huang, Xiaqing Wu, Shuang Wu
RoaD: Rollouts as Demonstrations for Closed-Loop Supervised Fine-Tuning of Autonomous Driving Policies
Guillermo Garcia-Cobo, Maximilian Igl, Peter Karkus, Zhejun Zhang, Michael Watson, Yuxiao Chen, Boris Ivanovic, Marco Pavone
PAVE: An End-to-End Dataset for Production Autonomous Vehicle Evaluation
Xiangyu Li, Chen Wang, Yumao Liu, Dengbo He, Jiahao Zhang, Ke Ma
RoadTones: Tone Controllable Text Generation from Road Event Videos
Chirag Parikh, Siddhi Pravin Lipare, Ravi Kiran Sarvadevabhatla
GRADE: Guiding Realistic Autonomous Driving with Adaptive Trajectory Evolution
Zehong Ke, Zhiyuan Liu, Yuning Wang, Jinhao Li, Junkai Jiang, Yanbo Jiang, Zhenhua Xu, Jianqiang Wang
SurfelOcc: Self-supervised Occupancy Prediction via 2D Surfel Splatting
Jikai Wang, Xingtai Gui, Jiahao Gong, Feiyang Tan, Wencheng Han, Cheng-Zhong Xu, Jianbing Shen
dVLM-AD: Enhance Diffusion Vision-Language-Model for Driving via Controllable Reasoning
Yingzi Ma, Yulong Cao, Wenhao Ding, Shuibai Zhang, Yan Wang, Boris Ivanovic, Ming Jiang, Marco Pavone, Chaowei Xiao
Devil is in Narrow Policy: Unleashing Exploration in Driving VLA Models
Canyu Chen, Yuguang Yang, Zhewen Tan, Yizhi Wang, Ruiyi Zhan, Haiyan Liu, Xuanyao Mao, Jason Bao, Xinyue Tang, Linlin Yang, Bingchuan Sun, Yan Wang, Baochang Zhang
Learning Vision-Language-Action World Models for Autonomous Driving
Guoqing Wang, Pin Tang, Xiangxuan Ren, Guodongfang Zhao, Bailan Feng, Chao Ma
AD-R1: Closed-Loop Reinforcement Learning for End-to-End Autonomous Driving with Impartial World Models
Tianyi Yan, Tao Tang, Xingtai Gui, Yongkang Li, Jiasen Zheng, Weiyao Huang, Lingdong Kong, Wencheng Han, Xia Zhou, Xueyang Zhang, Yifei Zhan, Kun Zhan, Cheng-zhong Xu, Jianbing Shen
Pseudo-Expert Regularized Offline RL for End-to-End Autonomous Driving in Photorealistic Closed-Loop Environments
Chihiro Noguchi, Takaki Yamamoto
OmniDrive-R1: Reinforcement-driven Interleaved Multi-modal Chain-of-Thought for Trustworthy Vision-Language Autonomous Driving
Zhenguo Zhang, Haohan Zheng, Yishen Wang, Le Xu, Tianchen Deng, Xuefeng Chen, Qu Chen, Bo Zhang, Wuxiong Huang
CoRT-Predictor: Chain of Risk Thought Autoregressive Trajectory Predictor for Autonomous Driving
Yanlin Jiang, Yuchen Liu, Mingren Liu
C^2T: Captioning-Structure and LLM-Aligned Common-Sense Reward Learning for Traffic–Vehicle Coordination
Yuyang Chen, Kaiyan Zhao, Yiming Wang, Ming Yang, Bin Rao, Zhenning Li
PEARL: A Lightweight Prompt-based Feature Interpreter Framework for Real-Time, Anonymous, and Heterogeneous Collaborative Perception
Armin Maleki, Hayder Radha
Variable-View Diffusion with Geometric Uncertainty Unlocks LiDAR Upsampling
Pengfei Yang, Sifu Luo, Feng Wu, Fan Zhou, Ting Zhong
RQR3D: Reparametrizing the regression targets for BEV-based 3D object detection
Ozsel Kilinc, Cem Tarhan
On the Feasibility and Opportunity of Autoregressive 3D Object Detection
Zanming Huang, Jinsu Yoo, Sooyoung Jeon, Zhenzhen Liu, Mark Campbell, Kilian Q Weinberger, Bharath Hariharan, Wei-Lun Chao, Katie Z Luo
See Tomorrow, Act Today: Foresight-Driven Autonomous Driving
Bozhou Zhang, Nan Song, Yuang Wang, Jiankang Deng, Xiatian Zhu, Li Zhang
Spatial Transcriptomics as Images for Large-Scale Pretraining
Yishun Zhu, Jiaxin Qi, Jian Wang, Yuhua Zheng, Jianqiang Huang
DiffGradCAM: A Class Activation Map Using the Full Model Decision to Solve Unaddressed Adversarial Attacks
Jacob Piland, Christopher Sweet, Adam Czajka
Modality-Aware and Anatomical Vector-Quantized Autoencoding for Multimodal Brain MRI
Mingjie Li, Edward Kim, Yue Zhao, Ehsan Adeli, Kilian M. Pohl
Fingerprint Fragment Expansion using Image Outpainting Approach based on Spectral Normalization PatchGAN
C. Zaghetto, A. Purim, W. Oliveira, J. R. Ribeiro, H. Nolla, F. Santos, M. Chang, R. H. Vareto
Improving Autoregressive Image Generation Through Coarse-to-Fine Token Prediction
Ziyao Guo, Kaipeng Zhang, Michael Qizhe Shieh
Intelligent Photo Retouching with Language Model-Based Artist Agents
Haoyu Chen, Keda Tao, YiZao Wang, Xinlei Wang, Lei Zhu, Jinjin Gu
Blockwise Divide-and-Aggregate for Image Restoration using Diffusion Priors
Vishal Purohit, Wei Chen, Qiang Qiu
Towards Imperceptible Watermarking Via Environment Illumination for Consumer Cameras
Hodaka Kawachi, Tomoya Nakamura, Hiroaki Santo, SaiKiran Kumar Tedla, Trevor D Canham, Yasushi Yagi, Michael S. Brown
Adaptive Continuous Kernel Networks for Image Reconstruction from Non-Uniform Sampling
Camille Biscarrat, Michaël Gharbi, Rahul Goel, Jonathan Ragan-Kelley, Frédo Durand, Tzu-Mao Li
Stability and Non-Local Modeling in Hybrid Convolution–Transformer Networks for Snapshot Hyperspectral Reconstruction
Xian-Hua Han
Breaking Degradation Coupling: A Structural Entropy–Guided Decoupled Framework and Benchmark for Infrared Enhancement
Pu Li, Huafeng Li, Yafei Zhang, Yu Liu, Wen Wang
Fast Generative DeOcclusion for Visual Geometry and Robotics
Jieneng Chen, Tiezheng Zhang, Xiwei Xuan, Ju He, Yifan Yin, Haojun Shi, Suyu Ye, Xinyi Li, Ruisheng Yuan, Tianmin Shu, Alan Yuille
FineCog-Nav: Integrating Fine-grained Cognitive Modules for Zero-shot Multimodal UAV Navigation
Dian Shao, Zhengzheng Xu, Peiyang Wang, Like Liu, Yule Wang, Jieqi Shi, Jing Huo
Unlocking Single-View Constraints for Efficient Camera Relocalization with Keypoint-Level Multi-View Geometric Consistency in Training
Hu Lin, Chengjiang Long, Jiqing Zhang, Chuanlu Jiang, Huilin Ge, Erwei Yin, Baocai Yin, Xin Yang
Evolve Vision-Language-Action Model into an Agent with On-the-fly Tool-use
Ding Yi, Yanzhao Yu, Xili Dai, Xianbiao Qi, Peiwen Sun, Xueqian Wang, Xiangyu Yue, Jianan Wang
Retrieval-VLA: Training-Free In-Context Adaptation for Vision-Language-Action Models
Yue Zhang, Rui Wang, Jiehong Lin, Zhongrui Wang, Xiaojuan Qi
Revisiting Articulated Parts Perception in Robot Manipulation
Xiaoqian Wu, Yejie Guo, Xiaoyang Chen, Lixin Yang, Cewu Lu, Yong-Lu Li
Re^2MoGen: Open-Vocabulary Motion Generation via LLM Reasoning and Physics-Aware Refinement
Jiakun Zheng, Ting Xiao, Shiqin Cao, Xinran Li, Zhe Wang, Chenjia Bai
Teleoperation, Simulation, or Human Video? Data Utilization Law for Robot Manipulation
Chenhao Shi, Yichen Zhu, Junjie Wen, Yefei Chen, Ziang Liu, Faming Fang
ShelfGaussian: Shelf-Supervised Open-Vocabulary Gaussian-Based 3D Scene Understanding
Lingjun Zhao, Yandong Luo, James Hays, Lu Gan
RoboTransfer: Controllable Geometry-Consistent Video Diffusion for Manipulation Policy Transfer
Liu Liu, Xiaofeng Wang, Guosheng Zhao, Keyu Li, Wenkang Qin, Jiagang Zhu, Jiaxiong Qiu, Guan Huang, Zhizhong Su
Switch-JustDance: Benchmarking Whole-Body Motion Tracking Controllers Using a Commercial Console Game
Jeonghwan Kim, Wontaek Kim, Yidan Lu, Jin Cheng, Fatemeh Zargarbashi, Zicheng Zeng, Zekun Qi, Zhiyang Dou, Nitish Sontakke, Donghoon Baek, Li Yi, Sehoon Ha, Tianyu Li
OminiMAG-SLAM : Unified Online Dual Graph Optimization for Multi-Agent Gaussian SLAM
Leqian Ding, Caibo Li, Yu Guo, Fei Wang
ReaAct: Bridging Robotic Reasoning and Action Generation Toward Real-World Spatial Generalization
Yanzhao Yu, Yi Ding, Peijun Tang, Haotian Yang, Xianbiao Qi, Jianan Wang, Xueqian Wang
Learning Multi-Task Robot Trajectory Segmentation from Visual and Kinematic Streams
Kaiyuan Chen, Shuangyu Xie, Andrew Goldberg, Ken Goldberg
LP3: LLM-based Potential Prediction Policy for Object Navigation using a Scene-Object Semantic Map
Wei Luo, Xiaohan Wang, Yuehu Liu
RoboScape-R: Unified Reward-Observation World Models for Generalizable Robotics Training via RL
Yinzhou Tang, Yu Shang, Yinuo Chen, Bingwen Wei, Xin Zhang, Shu'ang Yu, Liangzhi Shi, Chao Yu, Chen Gao, Wei Wu, Yong Li
CoTFly: Making UAVs Think Where to Fly Next Through Visual Chain-of-Thought Reasoning
Meiqi Wang, Longnyu Xu, Jun Liu, Hewu Li, Han Qiu
RU4D-SLAM: Reweighting Uncertainty in Gaussian Splatting SLAM for 4D Scene Reconstruction
Yangfan Zhao, Hanwei Zhang, Ke Huang, Qiufeng Wang, Zhenzhou Shao, Dengyu Wu
A1: Adaptive Truncated Vision-Language-Action Model from Affordance to Action
Kaidong Zhang, Jian Zhang, Rongtao Xu, Yu Sun, Youpeng Wen, Shuoshuo Xue, Xiaoyu Guo, Minghao Guo, Weijia Liufu, Liu Zihou, Kangyi Ji, Zihang Li, Ruiyi Chen, Meng Cao, Jingming Zhang, Shen Zhao, Xiaojun Chang, Feng Zheng, Ivan Laptev, Xiaodan Liang
Ego-Pi: VLA Fine-Tuning for Ego-Centric Human and Robot Data
Ji Woong Kim, Ke Wang, Zipeng Fu, Sirui Chen, Cong zhao, Jeff Lai, Chelsea Finn
MiVLA: Towards Generalizable Vision-Language-Action Model with Human-Robot Mutual Imitation Pre-training
Zhenhan Yin, Xuanhan Wang, Jiahao Jiang, Kaiyuan Deng, Pengqi Chen, Shuangle Li, Chong Liu, Xing Xu, Jingkuan Song, Lianli Gao, Heng Tao Shen
Riemannian Score-Based Diffusion for Language-Conditioned Grasp and Affordance Detection
Yan Li, Zhouchao Fu, Wenbin Lu, Junjie Zheng, Junnan Xu, Junjie Liao, Jianwei Zheng
DINO-VO: Learning Where to Focus for Enhanced State Estimation
Qi Chen, Guanghao Li, Sijia Hu, Xin Gao, Junpeng Ma, Xiangyang Xue, Jian Pu
Temporally-Smooth Global Bundle Adjustment for Real-Time Dense Visual SLAM
Cabrel Wouladje, Golden Tendekai Mumanikidzwa, Md Apon Islam, Huiying Xu, Hongbo Li, Wenzhe Tan, Zhendong Chen, Xinzhong Zhu
Masked Next-Scale Prediction For Self-Supervised Scene Text Recognition
Zhuohao Chen, Zeng Li, Yifei Zhang, Chang Liu, Yu Zhou
iTCTSL: Interpretable Tropical Cyclone Track and Intensity Forecasting via Task Sensitive Learning
Pan Mu, Yuchao Zhu, Shiqi Zhang, Hanting Yan, Jinglin Zhang, Cong Bai
Machine Vision-Oriented Appearance Design: Generate Natural And Robust Textures For 3D Meshes
Weihang Ran, Qingtian Zhu, Mingdeng Cao, Wei Yuan, Isao Echizen, Yinqiang Zheng
Bridge Your Fields: MeteoNet for Efficient Non-Uniform Meteorological Field Reconstruction
Xuanming Jiang, Baoyi An, Dingyu Nie, Haoyu Ren, Zhengwei Zou, Yizhe Yang, Jialie Shen, Zhiwen Jin, Xueming Qian, Zhongyu Yang, Guoshuai Zhao
Catalyst: Out-of-Distribution Detection via Elastic Scaling
Abid Hassan, Tuan Ngo, Saad Shafiq, Nenad Medvidovic
LUMINA: Learning and Understanding of Multimodal Information for Narrative and Affect-based Virality Prediction
Jiazhou Lin, Zhongyi Liu, Ying Shi, Zhichun Zhao, Zhuoyu Wang, Yuhang Zhou, Huanling Hu, Guangnan Ye, Mengtian Li, Lei Guo
LOOPE: Learnable Optimal Patch Order for Positional Encoders in Vision Transformers
Md Abtahi Majeed Chowdhury, Md Rifat Ur Rahman, Akil Ahmad Taki
Watermarking Matters for Deepfake Detection: A Proactive Method for Detecting Forgeries under Conventional Attacks
Zhiqiu Xia, Furong Mu, Qi Li, Shanshan Zhang, Jie Gui, Chunpeng Wang, Yunan Liu
CTFS : Collaborative Teacher Framework for Forward-Looking Sonar Image Semantic Segmentation with Extremely Limited Labels
Ping Guo, Chengzhou Li, Guanchen Meng, Qi Jia, Jinyuan Liu, Zhu Liu, Yu Liu, Zhongxuan Luo, Xin Fan
TPTransformer: Tensor–Tensor Product Transformer for Hyperspectral Image Super-Resolution
Honghui Xu, Chuangjie Fang, Yiqun Meng, Jiawei Jiang, Sixian Chan, Shiqing Zhang, Jianwei Zheng
Co-Adaptive Graph Learning Through Coupled Spectral Refinement for 3D Anomaly Detection
Hanvitha Saraswathi Mukkamala, Arun K Pujari
AndroidLong: LLM-based Android Agents Struggle with Long Looping Tasks
Xinghan Liu, Xiao Liu, Yifan Xu, Jiaqi Fu, Jiayu Huang, Yixuan Liu, Yuxiao Dong, Jie Tang
Multimodal Large Language Models as Image Classifiers
Nikita Kisel, Illia Volkov, Klara Janouskova, Jiri Matas
Beyond Recognition: Evaluating Visual Perspective Taking in Vision Language Models
Gracjan Góral, Alicja Ziarko, Piotr Miłoś, Michał Nauman, Maciej Wołczyk, Michał Kosiński
Exploring the best way for UAV visual localization under Low-altitude Multi-view Observation Condition: a Benchmark
Yibin Ye, Xichao Teng, Shuo Chen, Leqi Liu, Kun Wang, Xiaokai Song, Zhang Li
Benchmarking Layout-Guided Diffusion Models through Unified Semantic-Spatial Evaluation in Closed and Open Settings
Luca Parolari, Nicla Faccioli, Lamberto Ballan
RefDrone: A Challenging Benchmark for Referring Expression Comprehension in Drone Scenes
Zhichao Sun, Yepeng Liu, Zhiling Su, Huachao Zhu, Yuliang Gu, Yuda Zou, Zelong Liu, Gui-Song Xia, Bo Du, Yongchao Xu
Vision Language Models are Confused Tourists
Patrick Amadeus Irawan, Ikhlasul Akmal Hanif, Muhammad Dehan Al Kautsar, Genta Indra Winata, Fajri Koto, Alham Fikri Aji
LenghuSky-8: An 8-Year All-Sky Cloud Dataset with Star-Aware Masks and Alt-Az Calibration for Segmentation and Nowcasting
Yicheng Rui, Xiao-Wei Duan, Licai Deng, Fan Yang, Zhengming Dang, Zhengjun Du, Junhao Peng, Wenhao Chu, Umut Mahmut, Kexin Li, Yiyun Wu, Fabo Feng
Through the PRISM: Principle-Aware, Interpretable, and Multi-Scale Evaluation of Visual Designs
Mona Gandhi, K.J. Joseph, Srinivasan Parthasarathy, Sayan Nag
AEGIS: Exploring the Limit of World Knowledge Capabilities for Unified Multimodal Models
Jintao Lin, Bowen Dong, Weikang Shi, Chenyang Lei, Suiyun Zhang, Rui Liu, Xihui Liu
Name That Part: 3D Part Segmentation and Naming
Soumava Paul, Prakhar Kaushik, Ankit Vaidya, Anand Bhattad, Alan Yuille
Do MLLMs Exhibit Human-like Perceptual Behaviors? HVSBench: A Benchmark for MLLM Alignment with Human Perceptual Behavior
Jiaying Lin, Shuquan Ye, Dan Xu, Wanli Ouyang, Rynson W. H. Lau
Memorization in 3D Shape Generation: An Empirical Study
Shu Pu, Boya Zeng, Kaichen Zhou, Mengyu Wang, Zhuang Liu
Shape and Texture Recognition in Large Vision-Language Models
Sagi Eppel, Mor Bismut, Alona Strugatski
U-SEG: Uncertainty in SEGmentation - A systematic multi-variable exploration
Michael Smith, Frank P. Ferrie
UDVideoQA: A Traffic Video Question Answering Dataset for Multi-Object Spatio-Temporal Reasoning in Urban Dynamics
Joseph Raj Vishal, Nagasiri Poluri, Katha Naik, Rutuja Patil, Kashyap Hegde Kota, Krishna Vinod, Prithvi Jai Ramesh, Mohammad Farhadi, Yezhou Yang, Bharatesh Chakravarthi
GOVTrack: Towards Generative Open-Vocabulary Multi-Object Tracking
Zekun Qian, Ruize Han, Zhixiang Wang, Liang Wan, Wei Feng
Towards Text-Guided Attribute-Disentangled Multimodal Representation Learning
Yibing Wei, Sudeep Katakol, Manuel Brack, Jinhong Lin, Haoyue Bai, Yu-Teng Li, Richard Zhang, Eli Shechtman, Hareesh Ravi, Ajinkya Kale
AndroidLens: Long-latency Evaluation with Nested Sub-targets for Android GUI Agents
Yue Cao, Yingyao Wang, Pi Bu, Jingxuan Xing, Wei Jiang, Zekun Zhu, Junpeng Ma, Sashuai Zhou, Tong Lu, Jun Song, Yu Cheng, Yuning Jiang, Bo Zheng
A2Z-10M+: Geometric Deep Learning with A-to-Z BRep Annotations for AI-Assisted CAD Modeling and Reverse Engineering
Pritham K Jena, Bhavika Baburaj, Tushar Anand, Vedant Dutta, Vineeth Ulavala, Sk Aziz Ali
MolRecBench-Wild: A Real-World Benchmark for Optical Chemical Structure Recognition
Haote Yang, Hui Wang, Chen Zhu, Jingchao Wang, Linye Li, Hongbin Lai, Huijie Ao, Yongxuan Lv, Jiang Wu, Jiaxing Sun, Lua Chen, Yuanyuan Cao, Ruijie Zhang, Shengxin Lu, Lijun Wu, Bin Wang, Conghui He
FinChart-Multimodal: A Dataset for Context-Injected Financial Chart Understanding with Aligned OHLCV Time Series
Devansh Garg
THEval. Evaluation Framework for Talking Head Video Generation
Nabyl Quignon, Baptiste Chopin, Yaohui Wang, Antitza Dantcheva
PolyReal: A Benchmark for Real-World Polymer Science Workflows
Wanhao Liu, Weida Wang, Jiaqing Xie, Suorong Yang, Jue Wang, Benteng Chen, Guangtao Mei, Zonglin Yang, Shufei Zhang, Yuchun Mo, Lang Cheng, Jin Zeng, Houqiang Li, Wanli Ouyang, Yuqiang Li
OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models
Yuping Yan, Yuhan Xie, Yuanshuai Li, Yingchao Yu, Lingjuan Lyu, Yaochu Jin
PureSpace: A Benchmark for Abstract Spatial Reasoning in Vision-Language Models
Jinkai Li, Zhenliang Zhang, Lifeng Fan, Wei Wang
Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models
Junbo Niu, Yuanhong Zheng, Ziyang Miao, Hejun Dong, Chunjiang Ge, Hao Liang, Ma Lu, Bohan Zeng, Qiahao Zheng, Conghui He, Wentao Zhang
Beyond 3D Geometry: M3FD, a Large-Scale Dataset and Benchmark for Multimodal 3D Perceptual Understanding
Huan Hu, Ping Chen, Zezhou Chen, Zhaoxiang Liu, Zipeng Wang, Xiang Liu, Xin Wang, Kai Wang, Shiguo Lian
Paper2SysArch: Structure‑Constrained System Architecture Generation from Scientific Papers
Ziyi Guo, Zhou Liu, Wentao Zhang
WildRelight: A Real-World Dataset and Benchmark for Single-Image Relighting
Lezhong Wang, Mehmet Onurcan Kaya, Siavash Arjomand Bigdeli, Jeppe Revall Frisvad
EgoTL: Egocentric Think-Aloud Chains for Long-Horizon Tasks
Lulin Liu, Dayou Li, Yiqing Liang, Sicong Jiang, Hitesh Vijay, Hezhen Hu, Xuhai Xu, Zirui Liu, Srinivas Shakkottai, Manling Li, Zhiwen Fan
VibraVerse: A Large-Scale Geometry–Acoustics Alignment Dataset for Physically-Consistent Multimodal Learning
Bo Pang, Chenxi Xu, Jierui Ren, Guoping Wang, Sheng Li
When Harmful Content Goes Invisible: Unveiling Perception Failure of LVLMs with CAMOUHARMTI
Yanhui Li, Qi Zhou, Zhihong Xu, Huizhong Guo, Wenhai Wang, Dongxia Wang
Step-CoT: Stepwise Visual Chain-of-Thought for Medical Visual Question Answering
Lin Fan, Yafei Ou, Zhipeng Deng, Pengyu Dai, Chongxian Hou, Jiale Yan, Yaqian Li, Kaiwen Long, Xun Gong, Masayuki Ikebe, Yefeng Zheng
Real-IAD MVN: A Multi-View Normal Vector Dataset and Benchmark for High-Fidelity Industrial Anomaly Detection
Wenbing Zhu, Jianing Liang, Linjie Cheng, Yurui Pan, Zhuhao Chen, Qingwang Yan, Yudong Cheng, Jianghui Zhang, Mingmin Chi, Bo Peng
The Unwritten Benchmark: A New Challenge for Multimodal Machine Learning in Abstract Perceptual Reasoning
Garima Arya Yadav, Nilay Yilmaz, Yezhou Yang
Unifying Scientific Communication: Fine-Grained Correspondence Across Scientific Media
Megha Mariam K.M, Vineeth N. Balasubramanian, C.V. Jawahar
MathAll: A Real-World Benchmark for Mathematical Reasoning and Cross-Modal Understanding Evaluation in Omni-MLLMs
Zhilin Lin, Zhihui Zhang, Shiliang Sun, Jing Zhao, Hao Yang
Safe-LLaVA: A Privacy-Preserving Vision Language Dataset and Benchmark for Biometric Safety
Younggun Kim, Sirnam Swetha, Fazil Kagdi, Mubarak Shah
DR-DPO: Dual-Regularized DPO for Efficient Dataset Condensation
Haiduo Huang, Jiangcheng Song, Yadong Zhang, Guansu Wang, Pengju Ren
DrawingVQA: A Real-World Benchmark for Multi-Depth Visual–Textual Reasoning on Construction Drawings
Yoonhwa Jung, Junryu Fu, Mani Golparvar-Fard
SciPostGen: Bridging the Gap between Scientific Papers and Poster Layouts
Shun Inadumi, Shohei Tanaka, Tosho Hirasawa, Atsushi Hashimoto, Koichiro Yoshino, Yoshitaka Ushiku
Some Modalities are More Equal Than Others: Decoding and Architecting Multimodal Integration in MLLMs
Tianle Chen, Chaitanya Chakka, Arjun Reddy Akula, Xavier Thomas, Deepti Ghadiyaram
Towards Reliable Human Evaluations in Gesture Generation: Insights from a Community-Driven State-of-the-Art Benchmark
Rajmund Nagy, Hendric Voss, Thanh Hoang-Minh, Mihail Tsakov, Teodor Nikolov, Zeyi Zhang, Tenglong Ao, Sicheng Yang, Shaoli Huang, Yongkang Cheng, M. Hamza Mughal, Rishabh Dabral, Kiran Chhatre, Christian Theobalt, Libin Liu, Stefan Kopp, Rachel McDonnell, Michael Neff, Taras Kucherenko, Youngwoo Yoon, Gustav Eje Henter
SuperGlasses: Benchmarking Vision Language Models as Intelligent Agents for AI Smart Glasses
Zhuohang Jiang, Xu Yuan, Haohao Qu, Shanru Lin, Kanglong Liu, Wenqi Fan, Li Qing
InEdit-Bench: Benchmarking Intermediate Logical Pathways for Intelligent Image Editing Models
Zhiqiang Sheng, Xumeng Han, Zhiwei Zhang, Zenghui Xiong, Yifan Ding, Aoxiang Ping, Xiang Li, Tong Guo, Yao Mao
VEBench: Benchmarking Large Multimodal Models for Real-world Video Editing
Andong Deng, Dawei Du, Zhenfang Chen, Wen Zhong, Fan Chen, Guang Chen, Chia-Wen Kuo, Longyin Wen, Chen Chen, Sijie Zhu
CrowdVerse: A Bidirectional Reality-Calibrated Benchmark for Crowd Understanding and Simulation
Pingrui Lai, Yanshan Zhou, Zihao Xie, Hua Yang
Can Language Models Understand mmWave Data? Benchmarking Large Language Models for mmWave Radar-Based Human Understanding
Jeongwan Shin, Jaehyeon Kim, Donguk Ko, Jaeho Choi
From Static Snapshots to Dynamic Trajectories: Evaluating and Enhancing the Learning Pathways of Multimodal Large Language Models
Yukang Feng, Wenxiao Wu, Jianwen Sun, Chuanhao Li, Fanrui Zhang, Zizhen Li, Jiaxin Ai, Sizhuo Zhou, Yifan Chang, Changxin Gao, Shenglin Zhang, Kaipeng Zhang
Evaluating Dataset Watermarking for Fine-Tuning Traceability of Customized Diffusion Models: A Comprehensive Benchmark and Removal Approach
Xincheng Wang, Hanchi Sun, Wenjun Sun, Kejun Xue, Wangqiu Zhou, Jianbo Zhang, Wei Sun, Dandan Zhu, Xiongkuo Min, Jun Jia, Zhijun Fang
BMD-45: A Large-Scale CCTV Vehicle Detection Dataset for Urban Traffic in Developing Cities
Akash Sharma, Chinmay Mhatre, Sankalp Gawali, Ruthvik Bokkasam, Brij Sharma, Vishwajeet Pattanaik, Punit Rathore, Raghu Krishnapuram, Vijay Gopal Kovvali, Anirban Chakraborty, Yogesh Simmhan
SciGA: A Comprehensive Dataset for Designing Graphical Abstracts in Academic Papers
Takuro Kawada, Shunsuke Kitada, Sota Nemoto, Hitoshi Iyatomi
Splatwizard: A Benchmark Toolkit for 3D Gaussian Splatting Compression
Xiang Liu, Yimin Zhou, Jinxiang Wang, Yujun Huang, Shuzhao Xie, Shiyu Qin, Mingyao Hong, Jiawei Li, Yaowei Wang, Zhi Wang, Shu-Tao Xia, Bin Chen
See, Hear, and Understand: Benchmarking Audiovisual Human Speech Understanding in Multimodal Large Language Models
Le Thien Phuc Nguyen, Zhuoran Yu, Samuel Low Yu Hang, Subin An, Jeongik Lee, Yohan Ban, SeungEun Chung, Thanh-Huy Nguyen, JuWan Maeng, Soochahn Lee, Yong Jae Lee
Unlocking ImageNet’s Multi-Object Nature: Automated Large-Scale Multilabel Annotation
Junyu Chen, Md Yousuf Harun, Christopher Kanan
CATS-V2V: A Real-World Vehicle-to-Vehicle Cooperative Perception Dataset with Complex Adverse Traffic Scenarios
Hangyu Li, Bofeng Cao, Zhaohui Liang, Wuzhen Li, Juyoung Oh, Yuxuan Chen, Shixiao Liang, Hang Zhou, Chengyuan Ma, Jiaxi Liu, Zheng Li, Peng Zhang, Keke Long, Maolin Liu, Jackson Jiang, Chunlei Yu, Shengxiang Liu, Hongkai Yu, Xiaopeng Li
Seeing the Abstract: A Benchmark for Visual-Only Metaphor Understanding in Multimodal Large Language Models
Shan Zhao, Zhao Yang, Tianwei Yan, Yusong Gong, Qian Wan, Shizhao Chen, Shezheng Song, Chengyu Wang, Meng Wang
Cross-Dimensional Forgery Pattern Extraction for Generalizable Forgery Localization Framework
Yilin Wang, Dawei Luo, Shuai Chen, Feng Xu, Jiachi Wang, Zunlei Feng, Yijun Bei
Reliable Test-time Adaptation Via Evidential Uncertainty Modeling in Vision–Language Models
Yiwei You, Zan Chen, Bo Wang, Xiaofei Zhou
SPOT: Sparsification with Attention Dynamics via Token Relevance in Vision Transformers
Oded Schlesinger, Amirhossein Farzam, J. Matias Di Martino, Guillermo Sapiro
Do LLMs and VLMs Share Reasoning Neurons? Evidence and Mechanisms of Cross-Modal Transfer
Chenhang Cui, An Zhang, Yuxin Chen, Gelei Deng, Jingnan Zheng, Zhenkai Liang, Xiang Wang, Tat-Seng Chua
Debiased One-Shot NAS Via Density-Aware Sampling
Mehraveh Javan Roshtkhari, Matthew Toews, Marco Pedersoli
PSLIF: A Primary-Supplementary LIF Neuron for Spiking Neural Networks
Jie Guo, JunXiang Wu, Nan An, Zhen Zhang, Shuiying Xiang, Mingjin Zhang, Yunsong Li, Yu'e Gao
SHIELD: Secure Hypernetworks for Incremental Expansion Learning Defense
Patryk Krukowski, Łukasz Gorczyca, Piotr Helm, Kamil Książek, Przemysław Spurek
Eigen-Value: Efficient Domain-Robust Data Valuation Via Eigenvalue-Based Approach
Youngjun Choi, Joonseong Kang, Sungjun Lim, Kyungwoo Song
In2CLR: Joint Intra-Inter Curriculum Learning with Review for Degraded Fake Image Detection
Yunxuan Li, Bohao Liu, Yanxia Wu, Rongsheng Li
HAMSA: Scanning-Free Vision State Space Models via SpectralPulseNet
Badri N Patro, Vijay S Agneeswaran
Any-Class Presence Likelihood for Robust Multi-Label Classification with Abundant Negative Data
Dumindu Tissera, Omar Awadallah, Muhammad Umair Danish, Ayan Sadhu, Katarina Grolinger
VideoMatGen: PBR Materials through Joint Generative Modeling
Jon Hasselgren, Miloš Hašan, Zheng Zeng, Jacob Munkberg
TransKV: A Data-Driven Pruning Method for Large Foundation Models
Guangning Xu, Fanxu Meng, Ruijie Zhou, Michael K Ng, Wenjie Pei, Muhan Zhang
Image Classification Using CNN-QNN Hybrid Model with Optimized Correlated Features
Minseo Seong, Youngwook Kim
Dual Strategies for Test-Time Adaptation
Nam Nguyen Phuong, Duc Nguyen The Minh, Phi Le Nguyen, Ehsan Abbasnejad, Minh Hoai
CPUBone: Efficient Vision Backbone Design for Devices with Low Parallelization Capabilities
Moritz Nottebaum, Matteo Dunnhofer, Christian Micheloni
FLToM: Robust Federated Learning with Theory-of-Mind Structure
Tianshu Xiao, Liu Yang, Sichang Guo, Qilong Wang, Qinghua Hu
FedCVC: Federated Primal-Dual Learning with Client-Driven Virtual Compensation for Mitigating Dual Drift
Jinshan Lai, Tingxuan Huang, Baoyang Jiang, Liuyu Xiang, Qiang Ma, Jianwei Hu
Q-MambaIR: Accurate Quantized Mamba for Efficient Image Restoration
Yujie Chen, Haotong Qin, Zhang Zhang, Michele Magno, Luca Benini, Yawei Li
PHATE-Net: Differentiable Pseudotime Learning for Trustworthy Disease Trajectories in PET
Yixin Chen, Yan Wang, Wenrui Shao, Zhaoheng Xie
PoM: A Linear-Time Replacement for Attention with the Polynomial Mixer
David Picard, Nicolas Dufour, Lucas Degeorge, Arijit Ghosh, Davide Allegro, Tom Ravaud, Yohann Perron, Corentin Sautier, Zeynep Sonat Baltaci, Fei Meng, Syrine Kalleli, Marta López-Rauhut, Thibaut Loiseau, Ségolène Albouy, Raphael Baena, Elliot Vincent, Loic Landrieu
Qinling-GFFE: A Novel Station-based Benchmark and Graph-Frequency Fusion Enhancer for Precipitation Forecasting
Zhenhe Liang, Congqi Cao, Lanshu Hu, Liujie Pan
Deep Feedback ConvNets by Embedding the Working Memory Module for Image Classification
Lulu Fang, Jiaxiang Qin, Ruiheng Yan, Ning Pan, Haihua Liu, Xinxin Chen
MegAD: An Expert in Meta-Learning Guided Few-Shot Anomaly Detection
Xinying Li, Junfeng Jing, Tong Wu, Tian Gao, Zhihong Sheng
SGST-Transformer: A Spherical Geometry-Aware Spatio-Temporal Transformer for 360° Video Saliency Prediction
Kao Zhang, Tao Song, Zhihua Hu, Ming Li, Xin Ding
From Drops to Grid: Noise-Aware Spatio-Temporal Neural Process for Rainfall Estimation
Rafael Pablos Sarabia, Joachim Nyborg, Morten Birk, Ira Assent
AdaPerceiver: Transformers with Adaptive Width, Depth, and Tokens
Purvish Jajal, Nicholas John Eliopoulos, Benjamin Shiue-Hal Chou, George K Thiruvathukal, Yung-Hsiang Lu, James C. Davis
Texture-Guided Multiscale Cross-Modal Fusion for AI-Generated Image Quality Assessment
Qinlin Hu, Mingliang Zhou, Xingran Liao
Res2SPDNet: Multi-Granularity SPD Matrix Residual Learning for Signal Classification
Shenghui Yue, Rui Wang, Tianyang Xu, Tao Zhou, Xiao-Jun Wu, Josef Kittler
From Navigation to Refinement: Revealing the Two-Stage Nature of Flow-based Diffusion Models through Oracle Velocity
Haoming Liu, Jinnuo Liu, Yanhao Li, Liuyang Bai, Yunkai Ji, Yuanhe Guo, Shenji Wan, Hongyi Wen
MambaEye: A Size-Agnostic Visual Encoder with Causal Sequential Processing
Changho Choi, Minho Kim, Jinkyu Kim
Spectral-Aware Adaptive Convolution for Fine-Grained Cross-View Visual Localization
Linsi Wu, Gang Shen, Xuefei Lv, Chenglong Wu, Yuru Pei
Context-Aware Semantic Segmentation via Stage-Wise Attention
Antoine Carreaud, Elias Naha, Arthur Chansel, Nina Lahellec, Jan Skaloud, Adrien Gressin
MFI-ResNet: Efficient ResNet Architecture Optimization via MeanFlow Compression and Selective Incubation
Nuolin Sun, Linyuan Wang, Haonan Wei, Lei Li, Bin Yan
AlphaMerging: Orthogonal Subspace Projection of Task Vectors to Reduce Task Interference for Multi-Task Model Merging
Zuchi Bazarvaani, Seung-Ho Lee, Jeongmin Ahn, Donghyeon Jeon, Inho Kang, Seung-Hoon Na
Rethinking Compact (<1M) Vision Models: Balancing Accuracy and Speed through Multi-Path Atrous Convolutions
Christos Kyrkou
Hi3Doc: Hierarchical Tri-Level Representations for Multimodal Long-Document Understanding
Wanying Zhou, Zhuo Chen, Jianzhi Lu, Chenxi Ma, Weimin Tan, Bo Yan
LongDocSpan: Extending LVLMs for Long Document Understanding
Junwei Liu, Xiong Wang, Junchao Wu, Yefeng Liu, Congyun Jin, Jiangwei Lao, Junjie Wang, Derek F. Wong, Zhihong Lu, Jian Wang, Ping Wang
M-DocSum: Do LVLMs Genuinely Comprehend Interleaved Image-Text in Document Summarization?
Haolong Yan, Kaijun Tan, Yeqing Shen, Xin Huang, Jia Wang, Zheng Ge, Xiangyu Zhang, Si Li, Daxin Jiang
InstructTable: Improving Table Structure Recognition Through Instruction
Boming Chen, Zining Wang, Zhentao Guo, Jianqiang Liu, Chen Duan, Yu Gu, Kai zhou, Pengfei Yan
SciPostLayoutTree: A Dataset for Structural Analysis of Scientific Posters
Shohei Tanaka, Atsushi Hashimoto, Yoshitaka Ushiku
Efficient Document Parsing via Parallel Token Prediction
Lei Li, Ze Zhao, Meng Li, Zhongwang Lun, Yi Yuan, Xingjing Lu, Zheng Wei, Jiang Bian, Zang Li
ChartAgent: A Chart Understanding Framework with Tool Integrated Reasoning
Boran Wang, Xinming Wang, Yi Chen, Xiang Li, Jian Xu, Jing Yuan, Cheng-Lin Liu
RedVTP: Training-Free Acceleration of Diffusion Vision-Language Models Inference via Masked Token-Guided Visual Token Pruning
Jingqi Xu, Jingxi Lu, Chenghao Li, Sreetama Sarkar, Souvik Kundu, Peter A Beerel
FREE-Switch: Frequency-Based Dynamic LoRA Switch for Style Transfer
Shenghe Zheng, Minyu Zhang, Tianhao Liu, Hongzhi Wang
FedVG: Gradient-Guided Aggregation for Enhanced Federated Learning
Alina Devkota, Jacob Thrasher, Donald Adjeroh, Binod Bhattarai, Prashnna k. Gyawali
What and Where to Adapt: Structure–Semantics Co-Tuning for Machine Vision Compression via Synergistic Adapters
Shaobo Liu, Haobo Xiong, Kai Liu, Yuna Lin
A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models
Duo Li, Zuhao Yang, Xiaoqin Zhang, Ling Shao, Shijian Lu
GM-Skip: Metric-Guided Transformer Block Skipping for Efficient Vision-Language Models
Lianming Huang, Haibo Hu, Qiao Li, Xin He, Nan Guan, Chun Jason Xue
Dyna-ViT: Parameter-Free Pre-Encoder Token Pruning for Efficient Vision Transformers
Syeda Fiza Rubab, Arslan Abdul Ghaffar, Malik Junaid Jami Gul, Sheriff Murtala, Ingyu Lee, Gyu Sang Choi
Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention
Wenhu Zhang, Yiming Wu, Huanyu Wang, YaoYang Liu, Huanzhang Dou, Senqiao Yang, Sitong Wu, Hanbin Zhao, Jiaya Jia
Tiny Inference-Time Scaling with Latent Verifiers
Davide Bucciarelli, Evelyn Turri, Lorenzo Baraldi, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara
DaMN: Deleting and Migrating Normalization Layers from Transformers
Alexey Ryabykin, Irina Zhelavskaya, Egor Shvetsov, Alexey Rukhovich, Nikita Okhotnikov, Artem Khrapov, Evgeny Burnaev, Vladimir Mikhailovich Kryzhanovskiy
Enriching Knowledge Distillation with Cross-Modal Teacher Fusion
Amir M. Mansourian, Amir Mohammad Babaei, Shohreh Kasaei
UNIFORM: Unifying Knowledge from Large-scale and Diverse Pre-trained Models
Yimu Wang, Weiming Zhuang, Chen Chen, Jiabo Huang, Jingtao Li, Lingjuan Lyu
ProGIC: Progressive and Lightweight Generative Image Compression with Residual Vector Quantization
Hao Cao, Chengbin Liang, Wenqi Guo, Zhijin Qin, Jungong Han
MipKV: A Sparsify-then-Recover Paradigm for Accelerating Large Vision-Language Model Pre-Filling
Junming Zhang, Yifei Ji, Yongxuan Han, Zhenzhe Zheng
Mix-to-Max: Optimizing Data Mixtures for Peak Vision-Language Efficiency
Erwei Zhao, Haijin Zeng, Weiwei Xiao, Shijie Cao, Qiben Shan, Shaocong Wu, Jingyong Su, Jie Liu
INTERLACE: Interleaved Layer Pruning and Efficient Adaptation in Large Vision-Language Models
Parsa Madinei, Ryan Solgi, Ziqi Wen, Jonathan Skaza, Miguel Eckstein, Ramtin Pedarsani
JetViT: Efficient High-Resolution Vision Transformer with Post-Training Attention Search
Dongyun Zou, Zhuoyang Zhang, Junyu Chen, Wenkun He, Qinhe Peng, Hanrong Ye, Yao Lu, Hongxu Yin, Yu Wang, Song Han, Han Cai
SLAD : Shared LoRA Adapters for Task Specific Distillation
Reda Bensaid, Yassir Bendou, Vincent Gripon, François Leduc-Primeau
D4C: Data-Free Quantization for Contrastive Language-Image Pre-Training Models
Wenlun Zhang, Yunshan Zhong, Zihao Ding, Xinyu Li, Kentaro Yoshioka
ELSA: Exact Linear-Scan Attention for Fast and Memory-Light Vision Transformers
Chih-Chung Hsu, Xin-Di Ma, Wo-Ting Liao, Chia-Ming Lee
MPM: Mutual Pair Merging for Efficient Vision Transformers
Simon Ravé, Pejman Rasti, David Rousseau
Generalized Neighborhood Attention: Multi-dimensional Sparse Attention at the Speed of Light
Ali Hassani, Fengzhe Zhou, Aditya Kane, Jiannan Huang, Chieh-Yun Chen, Min Shi, Steven Walton, Markus Hoehnerbach, Vijay Thakkar, Mikhail Isaev, Qinsheng Zhang, Bing Xu, Haicheng Wu, Wen-mei Hwu, Ming-Yu Liu, Humphrey Shi
AlignFL: Adaptive Learning and Intelligent Generation of Networks for Federated Learning
Qilin Xiang, Qilin Fan, Xinrui Li, Tianfu Wang, Shuting Qiu, Yue Niu
Beyond Loss Values: Robust Dynamic Pruning via Loss Trajectory Alignment
Huaiyuan Qin, Muli Yang, Gabriel James Goenawan, Kai Wang, Zheng Wang, Peng Hu, Xi Peng, Hongyuan Zhu
Positive Divide and Negative Discrepancy: A New Perspective on Multi-Label Logit Distillation
Cong Li, Gong Cheng
Beyond Accuracy: An Empirical Study of Perception Stability in Multimodal Large Language Models
Feng Chen, Chenhui Gou, Yefei He, Yang Yang, Bohan Zhuang, Qi Wu
Event-VStream: Event-Driven Real-Time Understanding for Long Video Streams
Zhenghui Guo, Yuanbin Man, Junyuan Sheng, Bowen Lin, Ahmed Ahmed, Bo Jiang, Boyuan Zhang, Miao Yin, Sian Jin, Omprakash Gnawali, Chengming Zhang
M^3A Policy: Mutable Material Manipulation Augmentation Policy through Photometric Re-rendering
Jiayi Li, Yuxuan Hu, Haoran Geng, Xiangyu Chen, Chuhao Zhou, Ziteng Cui, Jianfei Yang
AOMGen: Photoreal, Physics-Consistent Demonstration Generation for Articulated Object Manipulation
Yulu Wu, Jiujun Cheng, Haowen Wang, Dengyang Suo, Pei Ren, Qichao Mao, Shangce Gao, Yakun Huang
Environmental Understanding Vision-language Model for Embodied Agent
Jinsik Bang, Jaeyeon Bae, Donggyu Lee, Siyeol Jung, Taehwan Kim
DEGround: An Effective Baseline for Ego-centric 3D Visual Grounding With a Homogeneous Framework
Yani Zhang, Dongming Wu, Hao Shi, Yingfei Liu, Tiancai Wang, Xingping Dong
Prune-Then-Plan: Step-Level Calibration for Stable Frontier Exploration in Embodied Question Answering
Noah Frahm, Prakrut Patel, Yue Zhang, Shoubin Yu, Mohit Bansal, Roni Sengupta
Think Twice, Act Once: Verifier-Guided Action Selection For Embodied Agents
Nishad Singhi, Christian Bialas, Snehal Jauhri, Vignesh Prasad, Georgia Chalvatzaki, Marcus Rohrbach, Anna Rohrbach
Plug-and-Think: Structured Reasoning for Vision–Language–Action Models
Kaikai Wei, Di wen, Xinhai Li, Senwei Xiang
World Model Robustness via Surprise Recognition
Geigh Zollicoffer, Tanush Chopra, Mingkuan Yan, Xiaoxu Ma, Kenneth Eaton, Mark Riedl
PlanGS: Active 3D Gaussian Reconstruction with Real-Time Planning
Wenxiang Xie, Anpei Chen, Haoming Yu, Yujun Shen, Weiwei Xu
A Simple Framework for Visual Navigation
Faith Johnson, Bryan Bo Cao, Shubham Jain, Ashwin Ashok, Kristin Dana
Generative Event Pretraining with Foundation Model Alignment
Jianwen Cao, Jiaxu Xing, Nico Messikommer, Davide Scaramuzza
HelixTrack: Event‑Based Tracking and RPM Estimation of Propeller-like Objects
Radim Spetlik, Michal Pliska, Vojtěch Vrba, Jiří Matas
PEPR: Privileged Event-based Predictive Regularization for Domain Generalization
Gabriele Magrini, Federico Becattini, Niccolò Biondi, Pietro Pala
Unleashing the Potential of Event-Based Stereo Via Coarse-to-Fine Bio-Inspired Regression
Haihao Zhang, Siwei Dong, Jianing Li, Rui Zhao, Yunjian Zhang, Geng Qin, Lin Zhu
Metric-Guided Feature Fusion of Visual Foundation Models for Segmentation Tasks
Yachan Guo, Jose Lu Gómez, Danna Xue, Yi Xiao, Antonio M. López
An Interpretable Alzheimer's Disease Diagnosis Model via Gray Matter Attention Guided Counterfactual Reasoning
Pengzhou Chen, Qiling Tang, XinYu Chai, Rong Liu, Zhi Li, Liman Liu
Beyond Semantics: Disentangling Information Scope in Sparse Autoencoders for CLIP
Yusung Ro, Jaehyun Choi, Junmo Kim
CLIP-Free, Label Free, Unsupervised Concept Bottleneck Models
Fawaz Sammani, Jonas Fischer, Nikos Deligiannis