Findings Poster Session
Findings Poster Session 3
Advancing Open-Set Detection and Segmentation via Disentangled Representations
Haokang Zhang, Yuchen Guan, Runxi Cheng, Yujiu Yang
Disrupting Positional Encoding for Effective Open Set Recognition
Yu Wang, Jiabo Xie, Yucan Zhou, Junxian Mu, Qinghua Hu, Pengfei Zhu
ODOV: Benchmark the Open-Domain Open-Vocabulary Object Detection
Yupeng Zhang, Ruize Han, Fangnan Zhou, Wei Feng, Liang Wan
Leave No Stone Unturned: Uncovering Holistic Audio-Visual Intrinsic Coherence for Deepfake Detection
Jielun Peng, Yabin Wang, Yaqi Li, Long Kong, Xiaopeng Hong
Region-Aware Hierarchical Sub-Feature Alignment for Robust EEG-Based Visual Decoding
Yanan Zhu, Ziwei Xiang, Jiamin Wu, Jinyang Guo, Hongyuan Zhang, Chunfeng Song, Hongjian Fang, Yufei Guo, Xianglong Liu
Bi-Level Optimization for Single Domain Generalization
Marzi Heidari, Hanping Zhang, Hao Yan, Yuhong Guo
SA-Matching DETR: A Lightweight Transformer Detector with Enhanced Scale Adaptive Matching
Chengshan Yang, Pengnian Zhang, Jinjing Zhao
Asymmetric Collaborative Distillation for Asymmetric Image Retrieval
Yi Xie, Huaidong Zhang, Xuandi Luo, Yan Zhou, Shengfeng He
OKGraph: Online Knowledge Graph Probing for Open-vocabulary Recognition
Junhui Yin, Zhizhen Cai, Puze Wang, Guanzhou Ke, Jianhua Yang, Man Zhang, Qiang Zhang, Shengfeng He
Large Multimodal Models as General In-Context Classifiers
Marco Garosi, Matteo Farina, Alessandro Conti, Massimiliano Mancini, Elisa Ricci
Indexing Multimodal Language Models for Large-scale Image Retrieval
Bahey Tharwat, Giorgos Kordopatis-Zilos, Pavel Suma, Ian Reid, Giorgos Tolias
EvoPrompt-ReID: A Bilevel Optimization Framework for Prompt-Encoder Co-evolution in Image Re-Identification
Yuanlin He, Zhenchuan Wang, Jun Chen, Yingying He, Jiabao Wang, Weiwen Wang, Kun Xu, zijin zhou, Xiaoxiao Wang, Mingju chen, Tingting Liu, Zhisong Pan
Leveraging Arbitrary Data Sources for AI-Generated Image Detection Without Sacrificing Generalization
Qinghui He, Haifeng Zhang, Xiuli Bi, Bo Liu, Chi-Man Pun, Bin Xiao
OmniGCD: Abstracting Generalized Category Discovery for Modality Agnosticism
Jordan Shipard, Arnold Wiliem, Kien Nguyen Thanh, Wei Xiang, Clinton Fookes
PTAD: Pose and Texture Agnostic Anomaly Detection
Wei Zhuo, Jianen Xiang, Miaomiao Liu, Huajun Lu
Mitigating the ID–OOD Tradeoff in Open-Set Test-Time Adaptation
Wenjie Zhao, Jia Li, Xin Dong, Yapeng Tian, Yu Xiang, Yunhui Guo
Towards Universal Open-Set Visual Font Recognition Via Augmented Synthetic Similarity
Peicheng Zhou, Shancheng Fang, Chenhui Jin, Bowei Pu, Hongtao Xie
VR-CLIP: Visual Refinement of CLIP for Zero-Shot Semantic Segmentation
Haitao Jiang, Xu Li, Yuanyang Cao, Ying Zhang, Jianji Wang
Exploring Hierarchical Consistency and Unbiased Objectness for Open-Vocabulary Object Detection
Sanghoon Lee, Geon Lee, Hyekang Park, Bumsub Ham
Once for All: An End-to-End Paradigm for VLM-Based Domain-Generalized Object Detection
Peng Zhang, Xiang Yuan, Cong Li, Junwei Han, Gong Cheng
SoREL: Soft-Label Refurbishment with Ensemble Learning for Noisy Long-Tailed Classification
Jun Wei Hsieh, Ying-Hsuan Wu, Yi-Kuan Hsieh, Xin Li, Kuan-Chuan Peng, Ming-Ching Chang
Unsupervised Graph Partitioning Framework for Background Suppression in Multi-Query Vehicle Re-Identification
Yichun Hu, Zixuan Hu, Ling-Yu Duan
Revisiting Real-Time Detection Transformer with Efficient Encoder Design
Jiannan Huang, Aditya Kane, Fengzhe Zhou, Yunchao Wei, Humphrey Shi
PASR: Pose-Aware 3D Shape Retrieval from Occluded Single Views
Jiaxin Shi, Guofeng Zhang, Wufei Ma, Naifu Liang, Adam Kortylewski, Alan Yuille
Ninja Codes: Neurally Generated Fiducial Markers for Stealthy 6-DoF Tracking
Yuichiro Takeuchi, Yusuke Imoto, Shunya Kato
DetRefiner: Model-Agnostic Detection Refinement with Feature Fusion Transformer
Soichiro Okazaki, Tatsuya Sasaki, Hiroki Ohashi
SpHOR: A Representation Learning Perspective on Open-set Recognition for Identifying Unknown Classes in Deep Neural Networks
Thiru Thillai Nadarasar Bahavan, Sachith Seneviratne, Saman Halgamuge
Complexity of Linear Regions in Self-supervised Deep ReLU Networks
Mufhumudzi Muthivhi, Terence L. van Zyl
Decoupled Sub-Feature Uncertainty Modeling for Robust Multimodal Representation Learning
Aoqiang Zhu, Min Hu, Yan Xing, Yiming Tang
Pre-trained Models Can Count (Almost): Exploring Quantitative Structure in Visual Representations
Toshimichi Aota, Akinori Hashimoto, Naoto Sekizuka, Takayuki Okatani
A-SelecT: Automatic Timestep Selection for Diffusion Transformer Representation Learning
Changyu Liu, James Chenhao Liang, Wenhao Yang, Yiming Cui, Jinghao Yang, Tianyang Wang, Qifan Wang, Dongfang Liu, Cheng Han
HyperFM: A Efficient Hyperspectral Foundation Model with Spectral Grouping
Zahid Hassan Tushar, Sanjay Purushotham
Seeing Through Fog: Towards Fog-Invariant Action Recognition
Enqi Liu, Liyuan Pan, Zhi Gao, Lingzhi Li, Qing Li
Reversing the Flow: Generation-to-Understanding Synergy in Large Multimodal Models
Yujun Tong, Dongliang Chang, Zijin Yin, Xintong Liu, Yuanchen Fang, Zhanyu Ma
FedAR: Attribute-Guided Representation Learning for Heterogeneous Federated Learning
Mengjie Li, Liu Yang, Qi Shen
ZeroDiff++: Balancing Semantic Diffusion Dynamics for Robust Zero-Shot Learning
Qin Li, Qi Li, Limei Liu, Junfeng Yang, Han Peng
Equivariant Unsupervised Object Detection with Learnable Riesz Transform and Composite Spatial Transformers
Sayan Kumar Chaki, Thierry Fournel, Rémi Emonet
MART: Mechanism-disentanglement Anchor-Routed Training for Learning with Open-World Noisy Data
Changhui Hu, Bhalaji Nagarajan, Ricardo Marques, Petia Radeva
Online Interpretable Matrix Decomposition for Large-Scale Streaming Data
Muhammad A. A. Abdelgawad, Abdelrahman B. M. Eldaly, Meng Xinmin, Peng Jing, Abdurrashid Ibrahim Sanka, Ray C.C. Cheung, Hong Yan
Object-Centric Vision Token Pruning for Vision Language Models
Guangyuan Li, Rongzhen Zhao, Jinhong Deng, Yanbo Wang, Joni Pajarinen
BrainStack: Neuro-MoE with Functionally Guided Expert Routing for EEG-Based Language Decoding
Ziyi Zhao, Jinzhao Zhou, Xiaowei Jiang, Beining Cao, Wenhao Ma, Yang Shen, Ren Li, Yu-Kai Wang, Chin-teng Lin
BiomedHELIX : HiErarchical-Local Interaction eXploration for Biomedical Vision-Language Models
Ziheng Zhu, Yuncheng Guo, Jie Xu, Xiaodong Gu
From Fewer Samples to Fewer Bits: Reframing Dataset Distillation as Joint Optimization of Precision and Compactness
My H. Dinh, Aditya Sant, Akshay Malhotra, Keya Patani, Shahab Hamidi-Rad
Layer Embedding Deep Fusion Graph Neural Network
Taihua Xu, Genhao Tian, Jicong Fan, Xibei Yang, Qinghua Zhang, Yun Cui
From Horizontal to Rotated: Cross-View Object Geo-Localization with Orientation Awareness
Chenlin Fu, Ao Gong, Xingtao Ling, Yingying Zhu
LinkedOut: Linking World Knowledge Representation Out of Video LLM for Next-Generation Video Recommendation
Haichao Zhang, Yao Lu, Lichen Wang, Yunzhe Li, Daiwei Chen, Yunpeng Xu, Yun Fu
Learning to Reason: Targeted Knowledge Discovery and Fuzzy Logic Update for Robust Image Recognition
Gurucharan Srinivas, Joshua Niemeijer, Frank Köster
GaussFiller: Unleashing VLM-Expert Guidance for 3D Scene Completion with 3D Gaussian Splatting
Yuhan Ping, Cheng Lin, Yuan Liu, Zhiyang Dou, Jia Pan, Wenping Wang
GEODE: Geometry-Guided Discrete Diffusion for Open-Vocabulary 3D Scene Graph Generation
Changqun Feng, Wangxiandi Yin, Xin Hu, Lei Zhao, Dongyang Zhang, Tao He
Map2Thought: Explicit 3D Spatial Reasoning via Metric Cognitive Maps
Xiangjun Gao, Zhensong Zhang, Dave Zhenyu Chen, Songcen Xu, Long Quan, Eduardo Pérez-Pellitero, Youngkyoon Jang
SCP: Spatial Causal Prediction in Video
Yanguang Zhao, Jie Yang, Shengqiong Wu, Shutong Hu, Hongbo Qiu, Yu Wang, Guijia Zhang, Tan Kai Ze, Hao Fei, Chia-Wen Lin, Mong-Li Lee, Wynne Hsu
SpatialDreamer: Incentivizing Spatial Reasoning via Active Mental Imagery
Meng Cao, Xingyu Li, Xue Liu, Ian Reid, Xiaodan Liang
Entropy-Constrained Information Optimal Transport for Multi-View Geo-Localization
Xiaoxi Yang, Bo Sun, Yisheng An, Ganchao Liu
Revisiting Image Manipulation Localization under Realistic Manipulation Scenarios
Xuekang Zhu, Ji-Zhe Zhou, Kaiwen Feng, Chenfan Qu, Xiwen Wang, Yunfei Wang, Liting Zhou, Jian Liu
Learning to Wander: Improving the Global Image Geolocation Ability of LMMs via Actionable Reasoning
Yushuo Zheng, Huiyu Duan, Zicheng Zhang, Xiaohong Liu, Xiongkuo Min
CADRNet: Cognitively-Inspired Active Vision for 3D Reasoning Segmentation via Differentiable Rendering
Zai Yang Yu, Changshuo Wang, Yuan Shi, Linjun Sun, Shu Wei, Tingran Wang, Wangyu Wu, Yanjie Li, Weijun Li
Direct Language Embedding Enables Gaussian Splatting for Large Scenes
Zhida Li, Jianqiao Zhu, Hejin Huang, Yipeng Qin, Sibei Yang, Guanbin Li
CogNet: Multi-Agent Collaborative Reasoning and Verification for Salient Object Ranking
Zhenyu Wu, Tengfei Shi, Xuehao Wang, Ming Li, Chenglizhao Chen, Wenfeng Song, Aimin Hao
MPerS: Dynamic MLLM MixExperts Perception-Guided Remote Sensing Scene Segmentation
Ziyi Wang, Xianping Ma, Ziyao Wang, Hongyang Zhang, Man On Pun
Towards Generalization of Scene Text Tampering Localization via Causal Invariance
Huiru Shao, Bin Dong, Kaizhu Huang, Xiaowei Huang, Qiufeng Wang
Background-Compensated Audio-Visual Semantic Modulation Framework for Audio-Visual Event Localization
Chao Sun, Junbo Zhang, Chuanbo Zhu, Mingjun Huang, Bo Du
POMA-3D: The Point Map Way to 3D Scene Understanding
Ye Mao, Weixun Luo, Ranran Huang, Junpeng Jing, Krystian Mikolajczyk
Gazemo: Mimicking Human Saccades via Foveal-Peripheral Feature Modeling for Lightweight Semantic Segmentation
Mian Muhammad Naeem Abid, Radu Timofte
MoonSeg3R: Monocular Online Zero-Shot Segment Anything in 3D with Reconstructive Foundation Priors
Zhipeng Du, Duolikun Danier, Jan Eric Lenssen, Hakan Bilen
AuralSAM2: Enabling SAM2 Hear Through Pyramid Audio-Visual Feature Prompting
Yuyuan Liu, Yuanhong Chen, Chong Wang, Junlin Han, Junde Wu, Can Peng, Jingkun Chen, Yu Tian, Gustavo Carneiro
PrAda: Few-Shot Visual Adaptation for Text-Prompted Segmentation
Gabriele Rosi, Fabio Cermelli, Carlo Masone, Barbara Caputo
SAGE: Shape-Adapting Gated Experts for Adaptive Histopathology Image Segmentation
Gia Huy Thai, Hoang-Nguyen Vu, Anh-Minh Phan, Quang-Thinh Ly, Thi-Ngoc-Truc Nguyen, Nhat Ho
Prompt-driven Small Object Instance Segmentation in Earth Observation
Chenhao Wang, Yingrui Ji, Yu Meng, Yunjian Zhang, Yao Zhu
OV-Stitcher: A Global Context-Aware Framework for Training-Free Open Vocabulary Semantic Segmentation
Seungjae Moon, Seunghyun Oh, Youngmin Ro
SCOPE: Scene-Contextualized Incremental Few-Shot 3D Segmentation
Vishal Thengane, Zhaochong An, Tianjin Huang, Son Lam Phung, Abdesselam Bouzerdoum, Lu Yin, Na Zhao, Xiatian Zhu
Towards Complete Activation: Foreground-Background Multi-Perspective Guided Cross-Support for Few-Shot Segmentation
Yi Yang, Qiang Jiao, Mengrui Shi, Qiang Zhang
ROSE: Retrieval-Oriented Segmentation Enhancement
Song Tang, Guangquan Jie, Henghui Ding, Yu-Gang Jiang
ConInfer: Context-Aware Inference for Training-Free Open-Vocabulary Remote Sensing Segmentation
Wenyang Chen, Zhanxuan Hu, Yaping Zhang, Hailong Ning, Yonghang Tai
Unify the Views: View-Consistent Prototype Learning for Few-Shot Segmentation
Hongli Liu, Yu Wang, Shengjie Zhao
Autoregressive Universal Video Segmentation Model
Miran Heo, Sukjun Hwang, Min-Hung Chen, Yu-Chiang Frank Wang, Albert Gu, Seon Joo Kim, Ryo Hachiuma
FCL-COD: Weakly Supervised Camouflaged Object Detection with Frequency-aware and Contrastive Learning
Jingchen Ni, Quan Zhang, Dan Jiang, Keyu Lv, Ke Zhang, Chun Yuan
Counterfactual Segmentation Reasoning: Diagnosing and Mitigating Pixel-Grounding Hallucination
Xinzhuo Li, Adheesh Juvekar, Jiaxun Zhang, Xingyou Liu, Muntasir Wahed, Kiet A. Nguyen, Yifan Shen, Tianjiao Yu, Ismini Lourentzou
Weakly-Supervised Referring Video Object Segmentation Through Text Supervision
Miaojing Shi, Jun Huang, Zijie Yue, Hanli Wang
TALENT: Target-Aware Efficient Tuning for Referring Image Segmentation
Shuo Jin, Siyue Yu, Bingfeng Zhang, Chao Yao, Meiqin Liu, Jimin Xiao
DeepDP-TGMM: Amortized Non-Parametric Clustering for Hyperspherical Self-Supervised Representations
Cyril Kana Tepakbong, Kévin Bouchard, Julien Maitre
Proto-SaGa: Prototype-based 3D Scene Segmentation with Semantic-aware Gaussian Grouping
Youngmin Oh, Changjae Oh, Bumsub Ham
RecycleLoRA: Rank-Revealing QR-Based Dual-LoRA Subspace Adaptation for Domain Generalized Semantic Segmentation
Chanseul Cho, Seokju Yun, Jaesung Jun, Seungjae Moon, Youngmin Ro
Instruction-Focus-Prompt:Semantics-Driven Structural Prompts for Universal SAM Segmentation
Shuqi Xia, Guangze Shi, Jiarui Cao, Aoyuan Shi, Meilin Liu, Xiaoyi Zhang, Yujie Wang, Xueyu Liu, Cai Zhao, Ziyuan He, Yongfei Wu, Mingqiang Wei
Continual Alignment for SAM: Rethinking Foundation Models for Medical Image Segmentation in Continual Learning
Jiayi Wang, Wei Dai, Haoyu Wang, Sihan Yang, Haixia Bi, Jian Sun
VirPro: Visual-Referred Probabilistic Prompt Learning for Weakly-Supervised Monocular 3D Detection
Chupeng Liu, Jiyong Rao, Shangquan Sun, Runkai Zhao, Weidong Cai
A Single Pixel is All You Need: Weakly Supervised Medical Image Segmentation using Discrete Denoising Diffusion Models
Mehmet Demirel, Christos Kyrkou
AdaMeta: Adaptive Meta-Learning with Dynamic Task Relational Inference for Few-shot learning
Xingyu Yang, Yidan Ma, Hanzhang Qu, Jianfu Cao
NRFP: A Noise-Robust Feature Plugin for Source-Free Domain Adaptation
Huanxin Zou, Zhize Wu, Yue Jiang, Jijian Zhou, Zhiwei Xu, Teng Li, Jianhua Shu, Fan Cheng
Learning from Label Proportion with Dual-Proportion Constraints
Tianhao Ma, Ximing Li, Changchun Li, Renchu Guan
Test-Time Distillation for Continual Model Adaptation
Xiao Chen, Jiazhen Huang, Zhiming Liu, Qinting Jiang, Fanding Huang, Jingyan Jiang, Zhi Wang
Task-Specific Knowledge Improves Generalization: A Logits-Based Framework for Continual Learning of Vision-Language Models
Sijie Wang, Yingying Zhu
DARN: Dynamic Adaptive Regularization Networks for Efficient and Robust Foundation Model Adaptation
Dhenenjay Yadav, Rohan Sawai
Training-Free Uncertainty-guided Logit Adjustment for Few-Shot Class-Incremental Learning
Sungwon Woo, Dongjun Hwang, Shiwon Kim, Junsuk Choe, Jongho Nang
Model Merging on Loss Landscapes: A Geometric Perspective
Juanwu Lu, Anand Bhaskar, Brian Axelrod, Ekaterina Tolstaya, Tristan Emrich
DGD: Density Gradient-guided Diffusion for Long-Tailed Clustering
Xulun Ye, Yuanyuan Deng, Kun Zhou
Bootstrap Your Own Classifier: Your Pretrained Vision Models are Secretly Strong Continual Learners
Yizheng Gong, Xiaoyang Wang, Siyue Yu, Waleed Al-Nuaimy, Jimin Xiao
Memory-efficient Continual Learning with Prototypical Exemplar Condensation
M.-Duong Nguyen, Thien-Thanh Dao, Le-Tuan Nguyen, Dung D. Le, Kok-Seng Wong
Continual Adaptation of Vision Foundational Models for Semantic Segmentation in Adverse Weather
Nikhil Kumar Jangamreddy, Mahsa Baktashmotlagh, Chetan Arora
ReMem: A Dynamic Memory Evolution Detector for Zero-Shot Anomaly Detection
Ling Yi, Zhe Chen, Gaochang Wu, Jinliang Ding, Xiaojie Wang, Zhaolong Ning
CurrMix: Curriculum-Enhanced MixUp for Long-Tailed Visual Recognition
Zhongquan Jian, Yanhao Chen, Bingbing Hu, Wenhan Lv, Shaopan Wang, Jipeng Wu, Junfeng Yao, Yang Lu, Qingqiang Wu
Class-Aware Drift Compensation for Non-Uniform Semantic Shift in Continual Learning
Fankang Xu, Lu Jin, Yanpeng Sun, Shiyu Xuan, Zechao Li
Onboarding Without Forgetting: Hypernetwork Personalization with Data-Free Replay for Personalized Federated Learning
Thinh Nguyen, Le Huy Khiem, Van-Tuan Tran, Khoa D Doan, Nitesh V. Chawla, Kok-Seng Wong
FedNPC: Stochastic Noise-driven Post-hoc Classifier Calibration Method for Federated Long-tailed Learning
Jintong Gao, He Zhao, Yibo Yang, Dandan Guo
Learning Multi-Modal Prototypes for Cross-Domain Few-Shot Object Detection
Wanqi Wang, Jingcai Guo, Yuxiang Cai, Zhi Chen
MuSCM: Mutual Spatial Correlation Mapping for Class Incremental Detection Transformer
Jian Zhong, Yifan Jiao, Xi Shao, Bing-Kun Bao
AFCL: Achieving Spatio-Temporal Invariance to Data Heterogeneity in Federated Continual Learning
Jianheng Tang, Jingyu He, Kejia Fan, Run He, Jingchao Wang, Anfeng Liu, Houbing Herbert Song, Leye Wang, Zhanxing Zhu, Huiping Zhuang, Yunhuai Liu
SAGA: Semantic Anchor-Guided Alignment for Multi-Source Domain Adaptive Object Detection
Yongchao Feng, Ziyue Huang, Jinqing Zhang, Wenrui Cai, Qingjie Liu
DEED: Dual-Channel Enhanced Ensemble Distillation for Uncertainty-Aware Recognition
Yang Yang, Kai Xu, Junyao Hou, Miao Zhang, Xiang Li, Zhenghua Chen, Yingxue Gao, Min Wu
Wake the Sleeping Weights: Sparsely-Activated Continual Test-Time Adaptation for Medical Image Segmentation
Jianhang Ji, Zhiming Cheng, Jianxiang Zhao, Bingtao Ma, Hao Chen, Yuhan Gao, Lian Zhang, Zuobin Ying, Shuai Wang
Dynamic Pseudo-Label Assignment and Consistent Prototypical Learning for Few-Shot Class-Incremental Learning
Zhilong Mao, Hang Zhang, Yanmin Li, Lihua Liu, Jibing Wu, Mao Wang
Hold-One-Shot-Out (HOSO) for Validation-Free Few-Shot CLIP Adapters
Chris Vorster, Mayug Maniparambil, Noel O'Connor, Noel Murphy, Derek Molloy
Learning through Creation: A Hash-Free Framework for On-the-Fly Category Discovery
Bohan Zhang, Weidong Tang, Zhixiang Chi, Yi Jin, Zhenbo Li, Yang Wang, Yanan Wu
Frequency-Guided Iterative Bi-directional Exchange Network for Cross-Domain Few-Shot Segmentation
Yadang Chen, Qi Liu, Guoqing Zhang, Le Sun, Yuhui Zheng
Revisiting Prototype Rehearsal for Exemplar-Free Continual Learning: Manifold-Aware Boundary Sampling with Adaptive Class-Balanced Loss
Hongye Xu, Bartosz Krawczyk
SCOPE: Spatially Ordered Continual Learning for 3D Segmentation
Wenhao Xu, Huaidong Zhang, Weipeng Zhang, Qianle Zhang, Shengfeng He
Learning to Propose Pose for Category-Agnostic Objects via Joint Refinement with Co-Matching Supervision
Junjie Chen, Zezheng Liu, Runxiang Liu, Yuming Fang, Yifan Zuo, Jiebin Yan
Is Prompt Selection Necessary for Task-Free Online Continual Learning?
Seoyoung Park, Haemin Lee, Hankook Lee
ReConText3D: Replay-based Continual Text-to-3D Generation
Muhammad Ahmed Ullah Khan, Muhammad Haris Bin Amir, Didier Stricker, Muhammad Zeshan Afzal
Now You See It, Now You Don't: Instant Concept Erasure for Safe Text-to-Image and Video Generation
Shristi Das Biswas, Arani Roy, Kaushik Roy
Safe Codebook: Token-Level Moderation for Safer Visual Autoregressive Generation
Jiaxuan Zhang, Qianqian Xu, Peisong Wen, Siran Dai, Yang Liu, Qingming Huang
Towards Universal and Lightweight Coverless Image Steganography with Multimodal Large Language Models Assistance
Jia Li, Zhankai Li, Yongqiang Yu, Xuehu Yan, Yuliang Lu
A Visual Semantic Adaptive Watermark Grounded by Prefix-Tuning for Large Vision-Language Model
Qi Zheng, Shuliang Liu, Yu Huang, Sihang Jia, Jungang Li, Lyuhao Chen, Junhao Chen, Hanqian Li, Aiwei Liu, Yibo Yan, Xuming Hu
TriGuard-FL: A User-Centric Trust Triad in Federated Learning via Auditable Data, Verifiable Contributions, and Antidote-Driven Mitigation
K Naveen Kumar, Mohsen Guizani
Assessing the Reliability of Image Quality Metrics and Mitigating Quality Bias in Generative Models
Hoin Jung, Shenyu Lu, De Wang, Xiaoqian Wang
Robust Continual Unlearning against Knowledge Erosion and Forgetting Reversal
Eun-Ju Park, Youjin Shin, Simon S. Woo
Memorization In Stable Diffusion Is Unexpectedly Driven by CLIP Embeddings
Bumjun Kim, Albert No
RAZOR: Ratio-Aware Layer Editing for Targeted Unlearning in Vision Transformers and Diffusion Models
Ravi Ranjan, Utkarsh Grover, Xiaomin Lin, Agoritsa Polyzou
FedOrtho: Efficient Federated Unlearning Via Orthogonal Convolution and Adaptive Soft Pruning
Qinghui Gong, Xue Yang, Xunlei Chen, Jinshan Lai, Hua Meng, Xiaohu Tang
Improving Synthesized Image Detection by Disentangling Generator-Shared and Generator-Specific Image Artifacts
Yongqi Yang, Yuke Li, Heng Huang, Zhihui Li, Bo Du, Yu Wu
PLR-Gate: Real-Time Gradient Privacy Assessment and Gated Transmission for Secure Federated Learning
Tao Huang, Jiayang Meng, Hong Chen, Chen Hou, Guolong Zheng, Xu Yang
A Unified Privacy-Utility Framework for Collaborative Inference via Randomized Smoothing
Shiwei Ding, Lan Zhang, Zhenlin Wang, Xiaoyong Yuan
Verify Claimed Text-to-Image Models Via Boundary-Aware Prompt Optimization
Zidong Zhao, Yihao Huang, Qing Guo, Tianlin Li, Anran Li, Kailong Wang, Jin Song Dong, Geguang Pu
Towards Robust Content Watermarking Against Removal and Forgery Attacks
Yifan Zhu, Yihan Wang, Xiao-Shan Gao
Revisiting Model Inversion Evaluation: From Misleading Standards to Reliable Privacy Assessment
Sy-Tuyen Ho, Koh Jun Hao, Ngoc-Bao Nguyen, Alexander Binder, Ngai-Man Cheung
CBDC: Clean Bias Direction Construction for Unsupervised Debiasing in Vision-Language Models
DoYoung Kim, SungJoon Hwang, Byung-Joon Lee, Joohyeon Lee, Jee-Hyong Lee
Erased, But Not Forgotten: Erased Rectified Flow Transformers Still Remain Unsafe Under Concept Attack
Nanxiang Jiang, Zhaoxin Fan, Enhan Kang, Daiheng Gao, Yun Zhou, Yanxia Chang, Zheng Zhu, Yeying Jin, Wenjun Wu
Leveraging Unlabeled Data from Unknown Sources via Dual-Path Guidance for Deepfake Face Detection
Zhiqiang Yang, Renshuai Tao, Chunjie Zhang, Guodong Yang, Xiaolong Zheng, Yao Zhao
SEM: Sparse Embedding Modulation for Post-Hoc Debiasing of Vision-Language Models
Quentin Guimard, Federico Bartsch, Simone Caldarella, Rahaf Aljundi, Elisa Ricci, Massimiliano Mancini
When Agents Steer Human Perception: How AI-Selected Images Can Convertly Alter Disagreements
Chi Zhang, Yulang Gao, Jiachen Zou, Chen Wei, Quanying Liu
UniShield: An Adaptive Multi-Agent Framework for Unified Forgery Image Detection and Localization
Qing Huang, Zhipei Xu, Xuanyu Zhang, Xiangyu Yu, Jian Zhang
On the Group Disparities Arising from Machine Unlearning
Zijie Pan, Zuobin Ying, Yajie Wang, Liehuang Zhu, Wanlei Zhou
Count What Repeats: Period-Adaptive Multi-Scale Consistency for Self-Supervised Repetitive Action Counting
Shizhao Gao, Jun Li, Qiming Li
Taming Hallucinations: Boosting MLLMs' Video Understanding via Counterfactual Video Generation
Zhe Huang, Hao Wen, Aiming Hao, Bingze Song, Meiqi Wu, Jiahong Wu, Xiangxiang Chu, Sheng Lu, Haoqian Wang
ConfDiff: Confidence-Guided Representation Diffusion for Video Moment Retrieval
Haiming Zhao, Tai Wang
Evolutionary Multi-Agent Collaboration for Real-World Video Face Restoration
Bowen Tang, Tao Wang, Miao Zhang, Xin Yu, Jinwei Chen, Bo Li, Kaihao Zhang
STS-Mixer: Spatio-Temporal-Spectral Mixer for 4D Point Cloud Video Understanding
Wenhao Li, Xueying Jiang, Gongjie Zhang, Xiaoqin Zhang, Ling Shao, Shijian Lu
HiVid-Narrator: Hierarchical Video Narrative Generation with Scene-Primed ASR-anchored Compression
Haoxuan Li, Mengyan Li, Junjun Zheng
D^2-STX: Decoupling Spatial-Temporal Cross-Attention for Dual-branch Repetitive Action Counting
Xiaoai Wang, Hang Wang, Yan Liu, Huan Hu, Bruce X.B. Yu
Group-DINOmics: Incorporating People Dynamics into DINO for Self-supervised Group Activity Feature Learning
Ryuki Tezuka, Chihiro Nakatani, Norimichi Ukita
Mamba-VMR: Multimodal Query Augmentation Via Generated Videos for Precise Temporal Grounding
Yunzhuo Sun, Xinyue Liu, Yanyang Li, Nanding Wu, Linlin Zong, Xianchao Zhang, Wenxin Liang
VideoThinker: Building Agentic VideoLLMs with LLM-Guided Tool Reasoning
Chenglin Li, Qianglong Chen, Feng Han, Yikun Wang, Xingxi Yin, Yan Gong, Ruilin Li, Yin Zhang, Jiaqi Wang
TP^2-DETR: Unlocking Deformable DETR for Zero-Shot Temporal Action Proposal Generation with Temporal Feature Pyramids
Ya-Yun Cheng, Kan Tippayamontri, Chih-Yuan Yang, Jane Yung-jen Hsu
QENN: A Quantum Entanglement-Inspired Neural Network for Interaction and Relationship Prediction in Story Videos
Zijun Xu, Zhengqian Wu, Chunjie Zhang, Zhongyuan Wang, Chunxia Xiao, Chao Liang
FineGrade: A Rule-Consistent Scoring Framework for Fine‑Grained Action Quality Assessment
Yicong Li, Howard Leung
One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition
Balaji Darur, Amanmeet Garg, Makarand Tapaswi
REBA: Residual Mixture-of-Experts and Bidirectional Video–Text Alignment for Better Fine-grained Weakly Supervised Video Anomaly Detection
Chengxi Chu, Nurul Japar, Chee Kau Lim
ReFoCUS: Reinforcement-guided Frame Optimization for Contextual Understanding
Hosu Lee, Junho Kim, Hyunjun Kim, Yong Man Ro
VIDEOP2R: Video Understanding from Perception to Reasoning
Yifan Jiang, Yueying Wang, Rui Zhao, Toufiq Parag, Zhimin Chen, Zhenyu Liao, Jayakrishnan Unnikrishnan
Video-R4: Reinforcing Text-Rich Video Reasoning with Visual Rumination
Yolo Yunlong Tang, Daiki Shimada, Hang Hua, Chao Huang, Jing Bi, Rogerio Feris, Chenliang Xu
ForestPrune: High-ratio Visual Token Compression for Video Multimodal Large Language Models Via Spatial-Temporal Forest Modeling
Shaobo Ju, Baiyang Song, Tao Chen, Jiapeng Zhang, Qiong Wu, Chao Chang, Huaixi Wang, Yiyi Zhou, Rongrong Ji
HARP: Hierarchical Adaptive Ranking with Probabilistic Modeling for Skill Determination
Hui Yu, Xiao Ke, Zhihong Zeng, Huangbiao Xu, Huanqi Wu
STORM: End-to-End Referring Multi-Object Tracking in Videos
Zijia Lu, Jingru Yi, Jue Wang, Yuxiao Chen, Junwen Chen, Xinyu Li, Davide Modolo
Extending Segment Anything Model 2 to Multi-Object Tracking by Optimizing Hierarchical Trajectory Memory
Cheng-Yen Yang, Hsiang-Wei Huang, Kuang-Ming Chen, Kunjun Li, Jenq-Neng Hwang
NCSTR: Node-Centric Decoupled Spatio-Temporal Reasoning for Video-based Human Pose Estimation
Quang Dang Huynh, Xuefei Yin, Andrew Busch, Hugo G. Espinosa, Alan Wee-Chung Liew, Matthew T.O. Worsey, Yanming Zhu
MOSSTrack : Modality-Specific Spatio-Temporal Context Learning for RGB-T Tracking
Yisong Liu, He Yao, Junlong Cheng, Yujie Lu, Junqi Bai, Min Zhu
Temporally Consistent Long-Term Memory for 3D Single Object Tracking
Jaejoon Yoo, SuBeen Lee, Yerim Jeon, Miso Lee, Jae-Pil Heo
DM^3T: Harmonizing Modalities via Diffusion for Multi-Object Tracking
Weiran Li, Yeqiang Liu, Yijie Wei, Mina Han, Qiannan Guo, Zhenbo Li
IRDINO: Adapting DINOv3 with Second-Order Motion Awareness for Moving Infrared Small Target Detection
Qian Xu, Shuaipeng Fan, Fei Gao, Mingjin Zhang
SemanticMoments: Training-Free Motion Similarity via Third Moment Features
Saar Huberman, Kfir Goldberg, Or Patashnik, Sagie Benaim, Ron Mokady
TAPNext++: What’s Next for Tracking Any Point (TAP)?
Sebastian Jung, Artem Zholus, Martin Sundermeyer, Carl Doersch, Ross Goroshin, David Joseph Tan, Sarath Chandar, Rudolph Triebel, Federico Tombari
ARGS: Auto-Regressive Gaussian Splatting via Parallel Progressive Next-Scale Prediction
Quanyuan Ruan, Kewei Shi, Jiabao Lei, Xifeng Gao, Xiaoguang Han
100Editor: 100+ Views per Batch and Minute-Scale View-Consistent 3D Editing
Cunqi Wu, Peng Zhou, Jie Qin, Qi Tian
DIAMOND-SSS: Diffusion-Augmented Multi-View Optimization for Data-efficient SubSurface Scattering
Guillermo Figueroa Araneda, Iris Dania Jimenez, Florian Hofherr, Manny Ko, Hector Andrade-Loarca, Daniel Cremers
Reason-SVG: Enhancing Structured Reasoning for Vector Graphics Generation with Reinforcement Learning
Ximing Xing, Ziteng Xue, Yandong Guan, Jing Zhang, Dong Xu, Qian Yu
Harmonized Multi-Layer Text-to-Image Generation with Generative Priors
Yusuf Dalva, Yijun Li, Qing Liu, Nanxuan Zhao, Jianming Zhang, Zhe Lin, Pinar Yanardag
StabiGS: Video Stabilization through Rendering-Aware Trajectory Optimization in 3DGS-Reconstructed Scenes
Souheib Ben Mabrouk, Jean-Emmanuel Deschaud, Eva Coupeté, Thomas Derbanne, Nicolas Rahmouni
More Traces Better: Unified Artifact Modeling for Generalizable and Robust AI-generated Image Detection
Ruiqi Liu, Xiaolei Lv, Zhiyuan Yan, Yi Han, Boyi Sun, Bo Li, Jun Gao, Lubin Weng, Yan Wang, Shu Wu
Predicting Gene Expression in Spatially Resolved Transcriptomics Across Samples Through Probabilistic Fusion of Hierarchical Histology and Spatial Information
Yinbo Liu, Qi Wu, Keyang Ye, Xiao He, Tian Tian
FraQAT: Quantization Aware Training with Fractional Bits
Luca Morreale, Alberto Gil C P Ramos, Malcolm Chadwick, Mehdi Noroozi, Ruchika Chavhan, Abhinav Mehrotra
MAGIC: Few-Shot Mask-Guided Anomaly Inpainting with Prompt Perturbation, Spatially Adaptive Guidance, and Context Awareness
JaeHyuck Choi, Minjun Kim, Je Hyeong Hong
Video Inspector: An Agentic-RL Framework and Benchmark for Human-Aligned Generative Video Evaluation
Jacey Somers, Harrison Zale, Janine Mason, Tina Walker, Eddie Quinn, Felix Lewis, Gavin Wright, Yvonne Young, Charles Sullivan, Wayne Carter, Julian Foster
From Pixels to Nucleotides: End-to-End Token-Based Video Compression for DNA Storage
Cihan Ruan, Lebin Zhou, Bingqing Zhao, Rongduo Han, Qiming Yuan, Chenchen Zhu, Linyi Han, Liang Yang, Wei Wang, Wei Jiang, Nam Ling
CoPS: Conditional Prompt Synthesis for Zero-Shot Anomaly Detection
Qiyu Chen, Zhen Qu, Wei Luo, Haiming Yao, Yunkang Cao, Yuxin Jiang, Yinan Duan, Huiyuan Luo, Chengkan Lv, Zhengtao Zhang
UI-AGILE: Advancing GUI Agents with Effective Reinforcement Learning and Precise Inference-Time Grounding
Shuquan Lian, Yuhang Wu, Jia Ma, Yifan Ding, Zihan Song, Bingqi Chen, Xiawu Zheng, Hui Li, Rongrong Ji
Beyond Static Artifacts: A Forensic Benchmark for Video Deepfake Reasoning in Vision Language Models
Zheyuan Gu, Qingsong Zhao, Yusong Wang, Zhaohong Huang, Xinqi Li, Chen Yuan, Jiawei Shao, Chi Zhang, Xuelong Li
GreenPlanner: Practical Floorplan Layout Generation via an Energy-Aware and Function-Feasible Generative Framework
Pengyu Zeng, Yuqin Dai, Jun Yin, Jing Zhong, Ziyang Han, Chaoyang Shi, ZhanXiang Jin, Maowei Jiang, Yuxing Han, Shuai Lu
Dual-Stage Parameter-Efficient Fine-Tuning for Consistent Spatial and Temporal Representation
Junhao Xia, Chaoyang Zhang, Yecheng Zhang, Chengyang Zhou, Zhichang Wang, Bochun Liu, Dongshuo Yin
WideEye: Achieving Wide Field-of-view Traffic Video Analytics With Dynamic Orientation Adaptation
Z. Jonny Kong, Sibendu Paul, Y. Charlie Hu
Restore-R1: Efficient Image Restoration Agents via Reinforcement Learning with Multimodal LLM Perceptual Feedback
Jianglin Lu, Yuanwei Wu, Ziyi Zhao, Hongcheng Wang, Felix Jimenez, Abrar Majeedi, Yun Fu
Pose-dIVE: Pose-Diversified Augmentation for Person Re-Identification
Inès Hyeonsu Kim, Woojeong Jin, Soowon Son, Junyoung Seo, Seokju Cho, JeongYeol Baek, Byeongwon Lee, JoungBin Lee, Seungryong Kim
Adaptive Reinforcement for Open-ended Medical Reasoning via Semantic-Guided Reward Collapse Mitigation
Yizhou Liu, Dingkang Yang, Zizhi Chen, Minghao Han, Xukun Zhang, Keliang Liu, Jingwei Wei, Lihua Zhang
BrandFusion: A Multi-Agent Framework for Seamless Brand Integration in Text-to-Video Generation
Zihao Zhu, Ruotong Wang, Siwei Lyu, Min Zhang, Baoyuan Wu
IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment
Zichen Zhu, Yuheng Sun, Mingxuan Zhu, Wenjie Ma, Situo Zhang, Zhexiang Wang, Ziyue Yang, Danyang Zhang, Kunyao Lan, Zihan Zhao, Dingye Liu, Siqi Xiang, Lu Chen, Kai Yu
QuPAINT: Physics-Aware Instruction Tuning Approach to Quantum Material Discovery
Xuan Bac Nguyen, Hoang-Quan Nguyen, Sankalp Pandey, Tim Faltermeier, Nicholas Borys, Hugh Churchill, Khoa Luu
CLIPtone-GO: Geometry‐Aware, Gradient-Orthogonalized Text-Guided Color Tone Adjustment
Satyam Merothiya, Chanda Grover Kamra, Indra Deep Mastan
Generative Digital Twins: Vision-Language Simulation Models for Executable Industrial Systems
YuChe Hsu, AnJui Wang, TsaiChing Ni, YuanFu Yang
Exploiting the Source-Asymmetry Confidence Gap for Generalizable AI-Generated Image Detection
Ziyang Zheng, Weiyan Chen, Yao Xiao, Zijie Cao, Dongyu Zhang, Pengxu Wei
CineMatte: Background Matting for Virtual Production and Beyond
Yuanjian He, Chen Zhang, Fasheng Chen, Jiangbo Cao
GATE: Gaussian-Attentive Transformer for Uncertainty-Aware Age Estimation
Chaewon Lee, JunHyeok Heo, Chang-Su Kim
GRAFT: Graph-Based Affordance Transfer via Part Correspondence
Mengying Lin, Utkarsh Mishra, Ajay Mandlekar, Danfei Xu
Face Time Traveller : Travel Through Ages Without Losing Identity
Purbayan Kar, Ayush Ghadiya, Vishal Chudasama, Pankaj Wasnik, C.V. Jawahar
KGGAT: Knowledge-Guided Graph Attention Network for Multi-Label Image Classification
Christine Dewi, Dhananjay R Thiruvady, Nayyar Zaidi
IntentEdit: Multi-Agent Reasoning for Intent-Driven Complex Image Editing
Yuxuan Zhang, Shijia Huang, Liwei Wang
Gen-n-Val: Agentic Image Data Generation and Validation
Jing-En Huang, I-Sheng Fang, Tzuhsuan Huang, Yu-Lun Liu, Chih-Yu Wang, Jun-Cheng Chen
SignReasoner: Compositional Reasoning for Complex Traffic Sign Understanding Via Functional Structure Units
Ruibin Wang, Zhenyu Lin, Xinhai Zhao
DARTS: Distance-Aware Robust Training for Selective Classification
A. Q. M. Sazzad Sayyed, Nathaniel D. Bastian, Francesco Restuccia
Modulate-and-Map: Crossmodal Feature Mapping with Cross-View Modulation for 3D Anomaly Detection
Alex Costanzino, Pierluigi Zama Ramirez, Giuseppe Lisanti, Luigi Di Stefano
PestVL-Net: Enabling Multimodal Pest Learning Via Fine-grained Vision-Language Interaction
Xueheng Li, Tao Hu, Ke Cao, Runsheng Qi, Huixin Zhang, Rui Li, Jie Zhang, Chengjun Xie
Plug-and-Play Dynamic In-context Learning with Stochastic Regularization for Screen Content Image Super-Resolution
Yuexin Wang, Xiaolei Wang, Guangliang Cheng, Huihui Bai, Tammam Tillo, Jimin Xiao
EscherNet++: A Scalable Multi-View Framework for Amodal Completion, Novel View Synthesis and Feed-Forward 3D Reconstruction
Xinan Zhang, Muhammad Zubair Irshad, Anthony Yezzi, Yi-Chang Tsai, Zsolt Kira
Human-Intervention Segmentation via Federated Intent Embedding and Multi-Mask Recommendation
Yeongsu Kim, Seo-Yeon Choi, Kyungsu Lee
Di3PO - Diptych Diffusion DPO for Targeted Improvements in Image Generation
Sanjana Reddy, Ishaan Malhi, Sally Ma, Praneet Dutta
Robust Image Self-Recovery against Tampering using Watermark Generation with Pixel Shuffling
Minyoung Kim, Paul Hongsuck Seo
Learning to Select, Learning to Judge: Active Preference Alignment for Mars Terrain Segmentation
JunJie Li, Miyu Li, Jiawei Wang, Yu Liu, Yumei Wang
Attention Never Lie: Visual Attention Defocus Reveals and Rectifies Hallucinations in MLLMs
Chenxi Zhao, Yan Zhou, Jufeng Yang
Organizing Unstructured Image Collections using Natural Language
Mingxuan Liu, Zhun Zhong, Jun Li, Gianni Franchi, Subhankar Roy, Elisa Ricci
Thinking with Blueprints: Assisting Vision–Language Models in Spatial Reasoning via Structured Object Representation
Weijian Ma, Shizhao Sun, Tianyu Yu, Ruiyu Wang, Tat-Seng Chua, Jiang Bian
Mitigating Object Hallucinations in LVLMs via Attention Imbalance Rectification
Han Sun, Qin Li, Peixin Wang, Min Zhang
Efficient3D : A Unified Framework for Adaptive and Debiased Token Reduction in 3D MLLMs
Yuhui Lin, Siyue Yu, Yuxing Yang, Guangliang Cheng, Jimin Xiao
HiViS: Hiding Visual Tokens from the Drafter for Speculative Decoding in Vision-Language Models
Zhinan Xie, Peisong Wang, Shuang Qiu, Jian Cheng
Visual Funnel: Resolving Contextual Blindness in Multimodal Large Language Models
Woojun Jung, Jaehoon Go, Mingyu Jeon, Sunjae Yoon, Junyeong Kim
Video Parallel Scaling: Aggregating Diverse Frame Subsets for VideoLLMs
Hyungjin Chung, Hyelin Nam, Jiyeon Kim, Hyojun Go, Byeongjun Park, Junho Kim, Joonseok Lee, Seongsu Ha, Byung-Hoon Kim
Reasoning for Mobile User Experience with Multimodal LLMs: Task, Benchmark, and Approach
Ruichao Mao, Zhou Fang, Teng Guo, Hao Yang, Yaping Li, Shaohua Peng, Maji Huang, Xiaoyu Lin, Shuoyang Liu, Xuepeng Li, Yuyu Zhang, Hai Rao
Visual Reasoning Through Tool-Supervised Reinforcement Learning
Qihua Dong, Gozde Sahin, Pei Wang, Zhaowei Cai, Robik Shrestha, Hao Yang, Davide Modolo
VSI: Visual–Subtitle Integration for Keyframe Selection to Enhance Long Video Understanding
Jianxiang He, Meisheng Hong, Jungang Li, Weiyu Guo, Xuming Hu, Hui Xiong
ProGAL-VLA: Grounded Alignment through Prospective Reasoning in Vision-Language-Action Models
Nastaran Darabi, Amit Ranjan Trivedi
Myopia Rectification: KV Cache Pruning for MLLMs Via Dynamic Attention Subsidy and Token Reclamation
Jiedong Zhuang, Lu Lu, Ming Dai, Jian Chen, Qiang Liu, Haoji Hu
NaiLIA: Multimodal Nail Design Retrieval Based on Dense Intent Descriptions and Palette Queries
Kanon Amemiya, Daichi Yashima, Kei Katsumata, Takumi Komatsu, Ryosuke Korekata, Seitaro Otsuki, Komei Sugiura
Logical Consistency Optimization for Few-Shot Weakly Supervised Video Anomaly Detection
Hantao Zheng, Ning Han, Yawen Zeng, Hegui Zhu, Hao Chen
VEGAS: Mitigating Hallucinations in Large Vision-Language Models via Vision-Encoder Attention Guided Adaptive Steering
Zihu Wang, Boxun Xu, Yuxuan Xia, Peng Li
COOPER: A Unified Model for Cooperative Perception and Reasoning in Spatial Intelligence
Zefeng Zhang, Xiangzhao Hao, Hengzhu Tang, Zhenyu Zhang, Jiawei Sheng, Xiaodong Li, Zhenyang Li, Li Gao, Daiting Shi, Dawei Yin, Tingwen Liu
CoVCR: Bridging Visual Narrative Gaps via Context Generation for Robust Commonsense Reasoning
Xinyu Li, Shiliang Sun
MMR1: Enhancing Multimodal Reasoning with Variance-Aware Sampling
Sicong Leng, Jing Wang, Jiaxi Li, Hao Zhang, Zhiqiang Hu, Boqiang Zhang, Yuming Jiang, Hang Zhang, Xin Li, Deli Zhao, Wei Lu, Yu Rong, Aixin Sun, Shijian Lu
Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding
Ziyang Wang, Honglu Zhou, Shijie Wang, Junnan Li, Caiming Xiong, Silvio Savarese, Mohit Bansal, Michael S. Ryoo, Juan Carlos Niebles
Benchmarking Vision-Language Models under Contradictory Virtual Content Attacks in Augmented Reality
Yanming Xiu, Zhengyuan Jiang, Neil Zhenqiang Gong, Maria Gorlatova
Language-Augmented Semantic Priors for B-Spline Surface Fitting
Yunzhong Lou, Yusheng Luo, Jiahao Li, Yu Song, Xiangdong Zhou
Flash-Unified: A Training-Free and Task-Aware Acceleration Framework for Native Unified Models
Junlong Ke, Zichen Wen, Boxue Yang, Yantai Yang, Xuyang Liu, Chenfei Liao, Zhaorun Chen, Shaobo Wang, Linfeng Zhang
Trajectory-Diversity-Driven Robust Vision-and-Language Navigation
Jiangyang Li, Cong Wan, SongLin Dong, Chenhao Ding, Qiang Wang, Zhiheng Ma, Yihong Gong
V-STaR: Benchmarking Video-LLMs on Video Spatio-Temporal Reasoning
Zixu Cheng, Jian Hu, Ziquan Liu, Chenyang Si, Wei Li, Shaogang Gong
Distilling Counterfactual Reasoning from Language to Vision: Causal Graph-Guided Post-Training for Video Understanding
Yuefei Chen, Jiang Liu, Xiaodong Lin, Ruixiang Tang
Exploring Physics-aware Video Generation through Reinforcement Learning with Autoregressive Tokens
Wang Lin, Liyu Jia, Wentao Hu, Kaihang Pan, Zhongqi Yue, Fengda Zhang, Wei Zhao, Jingyuan Chen, Fei Wu, Hanwang Zhang
Are Video Models Ready as Zero-Shot Reasoners? An Empirical Study with the MME-CoF Benchmark
Ziyu Guo, Xinyan Chen, Renrui Zhang, Ruichuan An, Yu Qi, Dongzhi Jiang, Xiangtai Li, Manyuan Zhang, Hongsheng Li, Pheng-Ann Heng
Overthinking Causes Hallucination: Tracing Confounder Propagation in Vision Language Models
Abin Shoby, Ta Duc Huy, Tuan Dung Nguyen, Minh Khoi Ho, Qi Chen, Anton van den Hengel, Phi Le Nguyen, Johan W. Verjans, Vu Minh Hieu Phan
GDP: Graph-Based Dynamic Personalization for Multimodal Large Language Models
Cong Ray, Xiangwen Deng, Feice Huang, ZhengXian Wu, Shen'ao Jiang, Peng Jiao, Zhifang Liu, Haoqian Wang
AnyExperts: On-Demand Expert Allocation for Multimodal Language Models with Mixture of Experts
Yuting Gao, Lan Wang, Hengyuan Zhao, Linjiang Huang, Si Liu, Qingpei Guo
Scaling Spatial Reasoning in MLLMs through Programmatic Data Synthesis
Helu Zhi, Jingjing Huang, Wang Xu, Yangbin Xu, Yibin Huang, Wanyue Zhang, Baoyang Jiang, Shirui Deng, Liang Zhu, FangFang Li, Tiejun Zhao, Yankai Lin, Yuan Yao
Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space
Chengzhi Liu, Yuzhe Yang, Yue Fan, Qingyue Wei, Sheng Liu, Xin Eric Wang
RVLF: A Reinforcing Vision–Language Framework for Gloss-Free Sign Language Translation
Zhi Rao, Yucheng Zhou, Benjia Zhou, Yiqing Huang, Sergio Escalera, Jun Wan
Weaver: End-to-End Agentic System Training for Video Interleaved Reasoning
Yudi Shi, Shangzhe Di, Qirui Chen, Qinian Wang, Jiayin Cai, Xiaolong Jiang, Yao Hu, Weidi Xie
AITP: Traffic Accident Responsibility Allocation via Multimodal Large Language Models
Zijin Zhou, Songan Zhang
Grounding Hierarchical Vision-Language-Action Models Through Explicit Language-Action Alignment
Theodor Wulff, Federico Tavella, Rahul Singh Maharjan, Manith Adikari, Angelo Cangelosi
Fine-Grained Visual Prompt and Region Self-Distillation for Retrieval-Augmented VQA
Yujie Wang, Hu Zhang, Jiye Liang, Zhiqiang Wang, Hongye Tan, Ru Li
RADSeg: Unleashing Parameter and Compute Efficient Zero-Shot Open-Vocabulary Segmentation Using Agglomerative Models
Omar Alama, Darshil Jariwala, Avigyan Bhattacharya, Seungchan Kim, Wenshan Wang, Sebastian Scherer
Modality-Aware Bit Allocation for Mixed-Precision Quantization of Vision-Language Models
Xi Zhang, Hanwei Zhu, Jiamang Wang, Xiaolin Wu, Weisi Lin
Switch-KD: Visual-Switch Knowledge Distillation for Vision-Language Models
Haoyi Sun, Xiaoxiao Wang, Ning Mao, Qian Wang, Lifu Mu, Wen Zheng, Tao Wei, Wei Chen
Analyzing and Enhancing Visual Learning in LLM-based Radiology Report Generation
Zailong Chen, Peng Gao, Johan Barthelemy, Luping Zhou, Lei Wang
DocSLM: A Small Vision-Language Model for Long Multimodal Document Understanding
Tanveer Hannan, Dimitrios Mallios, Parth Pathak, Faegheh Sardari, Thomas Seidl, Gedas Bertasius, Mohsen Fayyaz, Sunando Sengupta
EchoTrail-GUI: Building Actionable Memory for GUI Agents via Critic-Guided Self-Exploration
Runze Li, Yuwen Zhai, Bo Xu, Liwu Xu, Nian Shi, Wei Zhang, Ran Lin, Liang Wang
Semantic Guided Feature Disentanglement and Reconstruction for Domain Adaptive Object Detection
Xiaowei Zhao, Zhide Liu, Yuqing Ma, Xianglong Liu
Towards Efficient Multimodal Unified Reasoning Model via Model Merging
Qixiang Yin, Huanjin Yao, Jianghao Chen, Jiaxing Huang, Zhicheng Zhao, Fei Su
DeepSketcher: Internalizing Visual Manipulation for Multimodal Reasoning
Chi Zhang, Haibo Qiu, Qiming Zhang, Zhixiong Zeng, Lin Ma, Jing Zhang
Can Textual Reasoning Improve the Performance of MLLMs on Fine-Grained Visual Classification?
Jie Zhu, Yiyang Su, Xiaoming Liu
VRSA: Jailbreaking Multimodal Large Language Models through Visual Reasoning Sequential Attack
Shiji Zhao, Shukun Xiong, Yao Huang, Jin Yan, Zhenyu Wu, Jiyang Guan, Ranjie Duan, Jialing Tao, Hui Xue, Xingxing Wei
StreamEQA: Towards Streaming Video Understanding for Embodied Scenarios
Yifei Wang, Zhenkai Li, Tianwen Qian, Huanran Zheng, Zheng Wang, Yuqian Fu, Xiaoling Wang
MASS: Motion-Aware Spatial–temporal Grounding for Physics Reasoning and Comprehension in Vision-Language Models
Xiyang Wu, Zongxia Li, Jihui Jin, Gouthaman KV, Vishnu Raj, Nilotpal Sinha, Jingxi Chen, Fan Du, Dinesh Manocha
Beyond Syntax: Action Semantics Learning for App Agents
Bohan Tang, Dezhao Luo, Jianheng Liu, Jingxuan Chen, Shaogang Gong, Jianye Hao, Jun Wang, Kun Shao
CheXmix: Unified Generative Pretraining for Vision Language Models in Medical Imaging
Ashwin Kumar, Robbie Holland, Corey Barrett, Jangwon Kim, Maya Varma, Zhihong Chen, Yunhe Gao, Greg Zaharchuk, Tara Taghavi, Krishnaram Kenthapadi, Akshay Chaudhari
Mull-Tokens: Modality-Agnostic Latent Thinking
Arijit Ray, Ahmed Abdelkader, Chengzhi Mao, Bryan A. Plummer, Kate Saenko, Ranjay Krishna, Leonidas Guibas, Wen-Sheng Chu
SPHINX: A Synthetic Environment for Visual Perception and Reasoning
Md Tanvirul Alam, Saksham Aggarwal, Justin Yang Chae, Nidhi Rastogi
It’s Time to Get It Right: Improving Analog Clock Reading and Clock-Hand Spatial Reasoning in Vision-Language Models
Jaeha Choi, Jin Won Lee, Siwoo You, Jangho Lee
Uncertainty-Guided Graph Formulation via MWIS for Token Pruning in LVLMs
Jouwon Song, Sohyeon Kim, Kyeongbo Kong
From Alignment to Reason: Multi-Agent Debate for Tactical Badminton Video Retrieval
Yi-Xiang Zhang, Yu-Shuen Wang
Distilling Out-of-Distribution Knowledge from Large Language Models for CLIP Generalization
Qiji Ma, Chuanguang Yang, Zhulin An, Libo Huang, Erhu Zhao, Yuqi Li, Yongjun Xu
Multimodal Reasoning with Explicit Reasoning Patterns and Rewards
Han Qiu, Sheng Jin, Zhongrong Zuo, Ziyue Wang, Qi She, Ling Shao, Shijian Lu
VRAG-DFD: Verifiable Retrieval-Augmentation for MLLM-based Deepfake Detection
Hui Han, Shunli Wang, Yandan Zhao, Taiping Yao, Shouhong Ding
Mitigating Visual Context Degradation in Large Multimodal Models: A Training-Free Decoupled Agentic Framework
Hongrui Jia, Chaoya Jiang, Shikun Zhang, Wei Ye
CodePlot-CoT: Mathematical Visual Reasoning by Thinking with Code-Driven Images
Chengqi Duan, Kaiyue Sun, Rongyao Fang, Manyuan Zhang, Yan Feng, Ying Luo, Yufang Liu, Ke Wang, Peng Pei, Xunliang Cai, Hongsheng Li, Yi Ma, Xihui Liu
Do All Individual Layers Help? An Empirical Study of Task-Interfering Layers in Vision-Language Model
Zhiming Liu, Yujie Wei, Lei Feng, Xiu Su, Xiaobo Xia, Weili Guan, Zeke Xie, Shuo Yang
GenSRL: Generative Spatiotemporal Representation Learning for Ophthalmic Prognosis Prediction
Wanyu Zhang, Yanzhao Shi, Chengxin Zheng, Hua Wang, Jianing Wang, Yue Zhang, Xiaobing Yu, Xiaodan Zhang
Ramen: Robust Test-Time Adaptation of Vision-Language Models with Active Sample Selection
Wenxuan Bao, Yanjun Zhao, Xiyuan Yang, Jingrui He
LED: LLM Enhanced Open-Vocabulary Object Detection without Human Curated Data Generation
Yang Zhou, Shiyu Zhao, Yuxiao Chen, Zhenting Wang, Can Jin, Mingyu Zhao, Dimitris N. Metaxas
VSAS-Bench: Real-Time Evaluation of Visual Streaming Assistant Models
Pavan Kumar Anasosalu Vasu, Cem Koc, Fartash Faghri, Chun-Liang Li, Bo Feng, Zhengfeng Lai, Meng Cao, Oncel Tuzel, Hadi Pouransari
Mitigating Vision-Text Order Bias in Vision-Language Model
Weilin Gan, Yifan Song, Zhuocheng Yu, Sujian Li
MARS-RL: Enhancing Multi-Agent RAG Systems for Multi-Modal Documents via Strategic Reasoning with Reinforcement Learning
Zhongyu Wang, Pengbo Liu
Beyond Single Object: Learning 3D Relations with Large Language Models
Kohsuke Ide, Ryousuke Yamada, Yue Qiu, Xianzheng Ma, Yoshihiro Fukuhara, Hirokatsu Kataoka, Yutaka Satoh
CarePilot: A Multi-Agent Framework for Long-Horizon Computer Task Automation in Healthcare
Akash Ghosh, Tajamul Ashraf, Rishu Kumar Singh, Numan Saeed, Sriparna Saha, Xiuying Chen, Salman Khan
Attention-Space Contrastive Guidance for Efficient Hallucination Mitigation in LVLMs
Yujin Jo, Sangyoon Bae, Taesup Kim
UnrealSpace: Analyzing Spatial Understanding and Reasoning in Controllable Simulation
Wufei Ma, Sky Cen, Jianzhi Shen, Rex Lee, León Begiristain, Yan Zhuang, Jiawei Peng, Zhifei Yu, Tianao Song, Xinyuan Qi, Tianmin Shu, Adam Kortylewski, Alan Yuille
Frequency-Modulated Visual Restoration for Matryoshka Large Multimodal Models
Qingtao Pan, Zhihao Dou, Shuo Li
Learning When to Look: A Disentangled Curriculum for Strategic Perception in Multimodal Reasoning
Siqi Yang, Zilve Gao, Haibo Qiu, Fanfan Liu, Peng Shi, Zhixiong Zeng, Qingmin Liao, Lin Ma
Hierarchical Textual Knowledge for Enhanced Image Clustering
Yijie Zhong, Yunfan Gao, Weipeng Jiang, Haofen Wang
Are Multimodal Large Language Models Ready for Omnidirectional Spatial Reasoning?
Zihao Dongfang, Xu Zheng, Ziqiao Weng, Yuanhuiyi Lyu, Danda Pani Paudel, Luc Van Gool, Kailun Yang, Xuming Hu
Entropy-Based Visual Re-perception Inference for Multimodal Models
Jia Liufu, Qiangyu Yan, Zhehan Kan, Wenming Yang, Hailin Hu, Xinghao Chen, Borui Jiang
VACoT: Rethinking Visual Data Augmentation with VLMs
Zhengzhuo Xu, Chong Sun, SiNan Du, Chen Li, Jing Lyu, Chun Yuan
coDrawAgents: A Multi-Agent Dialogue Framework for Compositional Image Generation
Chunhan Li, Qifeng Wu, Jia-Hui Pan, Ka-Hei Hui, Jingyu Hu, Yuming Jiang, Bin Sheng, Xihui Liu, Wenjuan Gong, Zhengzhe Liu
PosterGen: Aesthetic-Aware Multi-Modal Paper-to-Poster Generation Via Multi-Agent LLMs
Zhilin Zhang, Xiang Zhang, Jiaqi Wei, Yiwei Xu, Chenyu You
Euclid’s Gift: Enhancing Spatial Perception and Reasoning in Vision-Language Models via Geometric Surrogate Tasks
Shijie Lian, Changti Wu, Laurence Tianruo Yang, Hang Yuan, Bin Yu, Lei Zhang, Kai Chen
Why MLLMs Struggle to Determine Object Orientations
Anju Gopinath, Nikhil Krishnaswamy, Bruce Draper
VADE: Variance-Aware Dynamic Sampling via Online Sample-Level Difficulty Estimation for Multimodal Reinforcement Learning
Zengjie Hu, Jiantao Qiu, Tianyi Bai, Haojin Yang, Binhang Yuan, Qi Jing, Conghui He, Wentao Zhang
Less is More: Token-Efficient Video-QA via Adaptive Frame-Pruning and Semantic Graph Integration
Shaoguang Wang, Weiyu Guo, Ziyang Chen, Yijie Xu, Xuming Hu, Hui Xiong
Alleviating Hallucinations in Large Vision-Language Models via Decoding-Time Perturbation Adaptation
Jiaqi Bai, Hongcheng Guo, Jiaheng Liu, Zhibo Zhou, Jian Yang, Feiran Huang
RISE: Enhancing VLM Image Annotation with Self-Supervised Reasoning
Suhang Hu, Wei Hu, Yuhang Su, Fan Zhang