Skip to yearly menu bar Skip to main content


Findings Poster Session

Findings Poster Session 2

Sat 6 Jun 6:30 a.m. PDT — 8 a.m. PDT
Abstract:
Chat is not available.


2
Zero-Shot Textual Explanations via Translating Decision-Critical Features

Toshinori Yamauchi, Hiroshi Kera, Kazuhiko Kawamoto


4
A Framework for Evaluating Zero-Shot Image Generation in Concept-Based Explainability

Giacomo Astolfi, Matteo Bianchi, Riccardo Campi, Antonio De Santis, Marco Brambilla


5
Self-Guided Integrated Gradient Method for Attribution

Sabrina Henry, Alice Ruget, Stirling Scholes, Jonathan Leach


6
Circuit Tracing in Vision-Language Models: Understanding the Internal Mechanisms of Multimodal Thinking

Jingcheng Yang, Tianhu Xiong, Shengyi Qian, Klara Nahrstedt, Mingyuan Wu


7
Discovering Attention Head Interactions in Vision Transformers

Zhenyu Lu, Yuheng Jia, Wei You, Hao Chen


8
Value bounds and Convergence Analysis for Averages of LRP attributions

Alexander Binder, Nastaran Takmil-Homayouni, Urun Dogan


9
MReactor: Offline Multiple Appropriate Facial Reaction Generation with Hierarchical Cognitive Disentanglement

Jiachen Luo, Jiajun He, Shuai Shen, Lin Wang, Huy Phan, Joshua Reiss, Lin Haijun, Bjoern Schuller, Zeyu Fu, Siyang Song


10
B-MoE: A Body-Part-Aware Mixture-of-Experts “All Parts Matter” Approach to Micro-Action Recognition

Nishit Poddar, Aglind Reka, Diana-Laura Borza, Snehashis Majhi, Michal Balazia, Abhijit Das, François Brémond


13
GHOST: Fast Category-Agnostic Hand-Object Interaction Reconstruction from RGB Videos Using Gaussian Splatting

Ahmed Tawfik Aboukhadra, Marcel Rogge, Nadia Robertini, Abdalla Arafa, Jameel Malik, Ahmed Elhayek, Didier Stricker


14
Hoi3DGen: Generating High-Quality Human-Object-Interactions in 3D

Agniv Sharma, Xianghui Xie, Tom Fischer, Eddy Ilg, Gerard Pons-Moll


15
CoherentHand: Temporally Consistent 3D Hand Trajectory Synthesis with Semantic Motion Priors

Bikram Boote, Junho Kim, Ozgur Kara, Sangmin Lee, James M Rehg


17
FUSION: Full-body Unified Motion Prior for Body and Hands Via Diffusion

Enes Duran, Nikos Athanasiou, Muhammed Kocabas, Michael J. Black, Omid Taheri


19
MARIO: Motion-Augmented Real-Time Multi-Sensor Inertial Odometry

Yiquan Li, Taeyoung Yeon, Chenfeng Gao, Vasco Xu, Xuanyou Liu, Karan Ahuja


20
BitTP: The Lightweight Trajectory Prediction Model with BitLLM for Edge-Devices

Mincheol Kang, HyunJin Lim, Bomin Kang, Daehee Park


21
WHOLE: World-Grounded Hand-Object Lifted from Egocentric Videos

Yufei Ye, Jiaman Li, Ryan Rong, C. Karen Liu


22
TalkVid: A Large-Scale Diversified Dataset for Audio-Driven Talking Head Synthesis

Shunian Chen, Hejin Huang, Yexin Liu, Zihan Ye, Pengcheng Chen, Chenghao Zhu, Michael Guan, Rongsheng Wang, Junying Chen, Jianye Hou, Bo Li, Guanbin Li, Ser-Nam Lim, Harry Yang, Benyou Wang


24
SocialMirror: Reconstructing 3D Human Interaction Behaviors from Monocular Videos with Semantic and Geometric Guidance

Qi Xia, Peishan Cong, Ziyi Wang, Yujing Sun, Qin Sun, Xinge Zhu, Mao Ye, Ruigang Yang, Yuexin Ma


25
EggHand: A Multimodal Foundation Model for Egocentric Hand Pose Forecasting

Jaeyoung Choi, Hyeondong Kim, Yujin Kim, Daehee Park


29
Detecting Precise Hand Touch Moments in Egocentric Video

Huy Anh Nguyen, Feras Dayoub, Minh Hoai


31
PHYLOMAN: Generative Behavior Control via Fusing LLM Planning and Physics-based Control

Jusheng Zhang, Jinzhou Tang, Sidi Liu, Jian Wang, Keze Wang


32
Contact Matrix: Enhancing Dance Motion Synthesis with Precise Interaction Modeling

Xuhai Chen, Zhi Cen, Huaijin Pi, Sida Peng, Xiaowei Zhou, Yong Liu


33
Learning Predictive Visuomotor Coordination

Wenqi Jia, Bolin Lai, Xu Cao, Miao Liu, Danfei Xu, James M. Rehg


34
FSMC-Pose: Frequency and Spatial Fusion with Multiscale Self-Calibration for Cattle Mounting Pose Estimation

Fangjing Li, Zhihai Wang, Xinxin Ding, Haiyang Liu, Ronghua Gao, Rong Wang, Yao Zhu, Ming Jin


35
Bootstrapping Sign Language Annotations with Sign Language Models

Colin Lea, Vasileios Baltatzis, Connor Gillis, Raja Kushalnagar, Lorna Quandt, Leah Findlater


36
OmniMotion-X: Versatile Multimodal Whole-Body Motion Generation

Guowei Xu, Yuxuan Bian, Ailing Zeng, Zhuo Chen, Mingyi Shi, Shaoli Huang, Wen Li, Lixin Duan, Qiang Xu


37
THOM: Generating Physically Plausible Hand-Object Meshes From Text

Uyoung Jeong, Yihalem Yimolal Tiruneh, Hyung Jin Chang, Seungryul Baek, Kwang In Kim


39
All-Age Human Mesh Recovery

Laura Bravo-Sánchez, Matthieu Armando, Romain Brégier, Grégory Rogez, Serena Yeung-Levy, Fabien Baradel


42
MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning

Yi-Yang Zhang, Tengjiao Sun, Pengcheng Fang, Deng-Bao Wang, Xiaohao Cai, Min-Ling Zhang, Hansung Kim


43
Fast-HOI: Fast Human-Object Interaction Synthesis via Distilled Interaction Prior and Physical Constrains

Xiaokang Pan, Zhizhong Zhang, Yangyuan Liu, Zhuoran Chen, Zhiwei Zhang, Bin Ji, Mingang Chen, Yong Xie, Jingyu Gong, Xuhong Wang, Xin Tan, Yuan Xie


44
HM-Talker: Hybrid Motion Modeling for High-Fidelity Talking Head Synthesis

Shiyu Liu, Kui Jiang, Junjun Jiang, Xianming Liu, Xiaocheng Feng, Fei Ma, Hongxun Yao, Qi Tian


45
GeoHOI: Geometry-Enhanced Human-Object Interaction Video Generation via Hierarchical Multi-Modal Injection

Ziyi Xu, Zejing Rao, Juan Cao, Xiaoqiang Liu, Zhixue Fang, Haoxian Zhang, Songlin Tang, Fan Tang


46
TAUE: Training-free Noise Transplant and Cultivation Diffusion Model

Daichi Nagai, Ryugo Morita, Shunsuke Kitada, Hitoshi Iyatomi


47
GR-Diffusion: Graph-Guided Relational-Aware Diffusion via Attention Alignment

Xiaochen Liu, Xiaoting Xi, Chao Yin, Xiaoqiang Li, Daoguo Dong


48
V-GRPO: Online Reinforcement Learning for Denoising Generative Models Is Easier than You Think

Bingda Tang, Yuhui Zhang, Xiaohan Wang, Jiayuan Mao, Ludwig Schmidt, Serena Yeung-Levy


49
FREESTYLE: An Anchor-Free Mechanism for Training-Free Style-Aligned Image Generation

Minseok Oh, Jihun Park, Jongmin Gim, Minwoo Choi, Kyoungmin Lee, Ferdinando Fioretto, Sunghoon Im


50
Is Your Text-to-Image Model Robust to Caption Noise?

Weichen Yu, Ziyan Yang, Shanchuan Lin, Qi Zhao, Jianyi Wang, Liangke Gui, Matt Fredrikson, Lu Jiang


52
RectifiedHR: Enable Efficient High-Resolution Synthesis via Energy Rectification

Zhen Yang, Guibao Shen, Minyang Li, Liang Hou, Mushui Liu, Luozhou Wang, Xin Tao, Ying-Cong Chen


55
Group Relative Attention Guidance for Image Editing

Xuanpu Zhang, Xuesong Niu, Ruidong Chen, Dan Song, Jianhao Zeng, Penghui Du, Haoxiang Cao, Kai Wu, An-an Liu


56
ControlPose: High-Fidelity Pose-Controlled Image Generation with Multi-Faceted Pose Disentanglement

Zhongjing Du, Xiao Chen, Zhiwei Nie, Yuxuan Chen, Chang Liu, Xiangyang Ji, Jie Chen


58
Latent-Compressed Variational Autoencoder for Video Diffusion Models

Jiarui Guan, Wenshuai Zhao, Zhengtao Zou, Juho Kannala, Arno Solin


59
Deep Parameter Interpolation for Scalar Conditioning

Chicago Y. Park, Michael T. McCann, Cristina Garcia-Cardona, Brendt Wohlberg, Ulugbek S. Kamilov


60
Mining Real-World Image Relations for Large-Scale Controllable Generation and Editing

Hao Shao, Liyang Liu, Zhengxiong Luo, Zhuofan Zong, Hongsheng Li


61
Disentangle Once, Control All: A Unified and Efficient Framework for Disentangling Multi-Condition Control in Human Video Generation

Runqi Wang, Chuming Wang, Fangqiu Yi, Yuying Zhao, Jingyu Xu, Yuhang Dai, Zheng Wang, Chi Zhang


62
HAM: A Training-Free Style Transfer Approach via Heterogeneous Attention Modulation for Diffusion Models

Yeqi He, Liang Li, Zhiwen Yang, Xichun Sheng, Zhidong Zhao, Chenggang Yan


64
Video4Spatial: Towards Visuospatial Intelligence with Context-Guided Video Generation

Zeqi Xiao, Yiwei Zhao, Lingxiao Li, Yushi Lan, Ning Yu, Rahul Garg, Mohammad H. Taghavi, Xingang Pan


66
Beyond Optimal Transport: Model-Aligned Coupling for Flow Matching

Yexiong Lin, Yu Yao, Yang Zhou, Tongliang Liu


67
Stochastic Perturbations Improve Distribution-to-Distribution Generative Models

Shiye Su, Yuhui Zhang, Linqi Zhou, Rajesh Ranganath, Serena Yeung-Levy


68
StereoSpace: Depth-Free Synthesis of Stereo Geometry via End-to-End Diffusion in a Canonical Space

Tjark Behrens, Anton Obukhov, Bingxin Ke, Fabio Tosi, Matteo Poggi, Konrad Schindler


70
Generated Reality: Human-Centric World Simulation Using Interactive Video Generation with Hand and Camera Control

Linxi Xie, Lisong C. Sun, Ashley Neall, Tong Wu, Shengqu Cai, Gordon Wetzstein


71
VHOI: Controllable Video Generation of Human–Object Interactions from Sparse Trajectories via Motion Densification

Wanyue Zhang, Lin Geng Foo, Thabo Beeler, Rishabh Dabral, Christian Theobalt


72
LoViC: Efficient Long Video Generation with Context Compression

Jiaxiu Jiang, Wenbo Li, Jingjing Ren, Yuping Qiu, Renjing Pei, Fenglong Song, Yong Guo, Xiaogang Xu, Han Wu, Wangmeng Zuo


73
FedErase: Personalized Federated Unlearning for Text-to-Image Diffusion Models

Tianyu Geng, Wenfei Liang, Sijie Wang, Rui She, Wee Peng Tay


75
Earthquake-Bench: Video Generation Benchmark for Earthquake Simulation

Lei Bao, Hao Chen, Yuyan Chen, Kui Wu, Lijia Chen, Fangwei Zhong, Feiran Huang, Bo Song, Han Yang


76
OmniInsert: Mask-Free Video Insertion of Any Reference via Diffusion Transformer Models

Jinshu Chen, Xinghui Li, Xu Bai, Tianxiang Ma, Pengze Zhang, Mengtian Li, Zhuowei Chen, Gen Li, Lijie Liu, Songtao Zhao, Bingchuan Li, Qian He


77
Block Cascading: Training Free Acceleration of Block-Causal Video Models

Hmrishav Bandyopadhyay, Nikhil Pinnaparaju, Rahim Entezari, Jim Scott, Yi-Zhe Song, Varun Jampani


78
Activation-Norm Maximization to Accelerate Training in Flow-Matching Transformers

Yash Belhe, Wesley Chang, Tzu-Mao Li, Ravi Ramamoorthi, Michaël Gharbi


79
FREE: Uncertainty-Aware Autoregression for Parallel Diffusion Transformers

Xinwan Wen, Bowen Li, Jiajun Luo, Ye Li, Zhi Wang


80
No Cache Left Idle: Accelerating diffusion model via Extreme-Slimming Caching

Tingyan Wen, Haoyu Li, Yihuang Chen, Xing Zhou, Lifei Zhu, XueQian Wang


81
Inference-Time Alignment of Diffusion Models with Evolutionary Algorithms

Purvish Jajal, Nicholas John Eliopoulos, Benjamin Shiue-Hal Chou, George K Thiruvathukal, James C. Davis, Yung-Hsiang Lu


83
VisionCreator: A Native Visual-Generation Agentic Model with Understanding, Thinking, Planning and Creation

Jinxiang Lai, Zexin Lu, Jiajun He, Rongwei Quan, Wenzhe Zhao, Qinyu Yang, Qi Chen, Qin Lin, Chuyue Li, Tao Gao, Yuhao Shan, Song Guo, Qinglin Lu


84
Animated-ART: Multi-Layer Transparent Video Generation

Ziqiang Li, Yunnan Wang, Dong Chen, Yue Dong, Ji Li, Yuhui Yuan, Xin Jin


86
Attention-Guided Energy Optimization for Label-Aligned Anomaly Generation

Zhibin Wan, Zhiqiang Gao, Mingjie Sun, Yupei Wu, Guohong Fu, Ran Yi


87
USV: Unified Sparsification for Accelerating Video Diffusion Models

Xinjian Wu, Hongmei Wang, Yuan Zhou, Qinglin Lu


88
OminPSD: Layered PSD Generation with Diffusion Transformer

Cheng Liu, Yiren Song, Haofan Wang, Mike Zheng Shou


89
Video2LoRA: Unified Semantic-Controlled Video Generation via Per-Reference-Video LoRA

Zexi Wu, Baolu Li, Jing Dai, Yiming Zhang, Yue Ma, Qinghe Wang, Xu Jia, Hongming Xu


90
Depth Adaptive Efficient Visual Autoregressive Modeling

Chunliang Li, Tianze Cao, Sanyuan Zhao


91
Cross-Resolution Diffusion Models Via Network Pruning

Jiaxuan Ren, Junhan Zhu, Huan Wang


92
FrameDiT: Diffusion Transformer with Matrix Attention for Efficient Video Generation

Minh Khoa Le, Kien Do, Duc Thanh Nguyen, Truyen Tran


93
Understanding Reward Hacking in Text-to-Image Reinforcement Learning

Yunqi Hong, Kuei-Chun Kao, Hengguang Zhou, Cho-Jui Hsieh


94
OminiControl2: Efficient Conditioning for Diffusion Transformers

Zhenxiong Tan, Qiaochu Xue, Xingyi Yang, Songhua Liu, Xinchao Wang


95
Seen-to-Scene: Keep the Seen, Generate the Unseen for Video Outpainting

Inseok Jeon, Minhyeok Lee, Seunghoon Lee, Minseok Kang, Suhwan Cho, Sangyoun Lee


98
InstaDA: Augmenting Instance Segmentation Data with Dual-Agent System

Xianbao Hou, Yonghao He, Zeyd Boukhers, John See, Hu Su, Wei Sui, Cong Yang


100
Adversarial Concept Distillation for One-Step Diffusion Personalization

Yixiong Yang, Tao Wu, Senmao Li, Shiqi Yang, Yaxing Wang, Joost van de Weijer, Kai Wang


101
DSA: Dynamic Step Allocation for Fast Autoregressive Video Generation

Thanh-Tung Le, Yunhan Zhao, Menglei Chai, Zhengyang Shen, Zhe Cao, Danhang Tang, Xiaohui Xie, Deying Kong


102
Anomaly Agent: Unified Anomaly Retrieval and Synthesis Before Manufacturing

Xiangyue Li, Xiaoyang Wang, Siyue Yao, Mingjie Sun, Yupei Wu


103
S^2DiT: Sandwich Diffusion Transformer for Mobile Streaming Video Generation

Lin Zhao, Yushu Wu, Aleksei Lebedev, Dishani Lahiri, Meng Dong, Arpit Sahni, Michael Vasilkovsky, Hao Chen, Ju Hu, Aliaksandr Siarohin, Sergey Tulyakov, Yanzhi Wang, Anil Kag, Yanyu Li


104
UniLat3D: Geometry-Appearance Unified Latents for Single-Stage 3D Generation

Guanjun Wu, Jiemin Fang, Chen Yang, Sikuang Li, Taoran Yi, Jia Lu, Zanwei Zhou, Jiazhong Cen, Lingxi Xie, Xiaopeng Zhang, Wei Wei, Wenyu Liu, Xinggang Wang, Qi Tian


105
ColorMam: Color-Aware State Space Model for Image Color Style Transfer

Jian Li, Jiaxin Peng, Yuchen Li, Siwang Zhou


107
Towards Source-Aware Object Swapping with Initial Noise Perturbation

Jiahui Zhan, Xianbing Sun, Xiangnan Zhu, Yikun Ji, Ruitong Liu, Liqing Zhang, Jianfu Zhang


108
SyntheticManga: Training-Free Manga Generation with Phased Diffusion

Xuelei Peng, Chi-Keung Tang, Yu-Wing Tai


109
Fast Autoregressive Video Generation with Diagonal Decoding

Yang Ye, Junliang Guo, Haoyu Wu, Tianyu He, Tim Pearce, Tabish Rashid, Katja Hofmann, Jiang Bian


110
E-GRPO: High Entropy Steps Drive Effective Reinforcement Learning for Flow Models

Shengjun Zhang, Zhang Zhang, Chensheng Dai, Yueqi Duan


111
Bind-Your-Avatar: Multi-Character-Talking Video Generation with Dynamic 3D-mask-based Embedding Router

Yubo Huang, Weiqiang Wang, Sirui Zhao, Tong Xu, Lin Liu, Enhong Chen


112
SCAIL: Towards Studio-Grade Character Animation via In-Context Learning of 3D-Consistent Pose Representations

Wenhao Yan, Sheng Ye, Zhuoyi Yang, Jiayan Teng, ZhenHui Dong, Kairui Wen, Xiaotao Gu, Yong-Jin Liu, Jie Tang


114
VideoCanvas: Unified Video Completion from Arbitrary Spatiotemporal Patches via In-Context Conditioning

Minghong Cai, Qiulin Wang, Zongli Ye, Wenze Liu, Quande Liu, Weicai Ye, Xintao Wang, Pengfei Wan, Kun Gai, Xiangyu Yue


115
Jano: Adaptive Diffusion Generation with Early-Stage Convergence Awareness

Yuyang Chen, Linqian Zeng, Yijin Zhou, Hengjie Li, Jidong Zhai


116
Low-Bitrate Video Compression through Semantic-Conditioned Diffusion

Lingdong Wang, Guan-Ming Su, Divya Kothandaraman, Tsung-Wei Huang, Mohammad Hajiesmaili, Ramesh K. Sitaraman


117
Decoupled Scale-wise Autoregressive Modeling for Visual Generation

Sucheng Ren, Yaodong Yu, Nataniel Ruiz, Feng Wang, Cihang Xie


118
TalkVerse: Democratizing Minute-Long Audio-Driven Video Generation

Zhenzhi Wang, Jian Wang, Ke Ma, Dahua Lin, Bing Zhou


119
Future Optical Flow Prediction Improves Robot Control and Video Generation

Kanchana Ranasinghe, Honglu Zhou, Yu Fang, Luyu Yang, Le Xue, Ran Xu, Caiming Xiong, Silvio Savarese, Michael S Ryoo, Juan Carlos Niebles


120
Stepper: Stepwise Immersive Scene Generation with Multiview Panoramas

Felix Wimbauer, Fabian Manhardt, Michael Oechsle, Nikolai Kalischek, Christian Rupprecht, Daniel Cremers, Federico Tombari


121
Drive-Cascade: Autoregressive Occupancy to LiDAR and Video Synthesis

Shuangming Lei, Yuehao Huang, Yao Yi, Yijia Xie, Jingke Wang, Ruoyu Wang, Jiajun Lv, Guanglin Xu, AiXue Ye, Bingbing Liu, Siyuan Cheng, Hongbo Zhang, Yukai Ma, Yong Liu


123
Concept Erasure via Attention Redirection

Amit Schechter, Rinon Gal, Ofir Kedem, Gal Chechik, Daniel Cohen-Or


124
Loom: Diffusion-Transformer for Interleaved Generation

Mingcheng Ye, Jiaming Liu, Yiren Song


125
Rethinking Training Dynamics in Scale-Wise Autoregressive Generation

Gengze Zhou, Chongjian Ge, Hao Tan, Feng Liu, Yicong Hong


126
HiStream: Efficient High-Resolution Video Generation via Redundancy Eliminated Streaming

Haonan Qiu, Shikun Liu, Zijian Zhou, Zhaochong An, Weiming Ren, Zhiheng Liu, Jonas Schult, Sen He, Shoufa Chen, Yuren Cong, Tao Xiang, Ziwei Liu, Juan-Manuel Perez-Rua


127
Eevee: Towards Close-up High-resolution Video-based Virtual Try-on

Jianhao Zeng, Yancheng Bai, Ruidong Chen, Xuanpu Zhang, Lei Sun, Dongyang Jin, Ryan Xu, Nannan Zhang, Dan Song, Xiangxiang Chu


128
Consistent Video Editing as Flow-Driven Image-to-Video Generation

Ge Wang, Songlin Fan, Hangxu Liu, Quanjian Song, Hewei Wang, Jinfeng Xu


129
IM-Animation: An Implicit Motion Representation for Identity-Decoupled Character Animation

Zhufeng Xu, Xuan Gao, Feng-Lin Liu, Haoxian Zhang, Zhixue Fang, Yu-Kun Lai, Xiaoqiang Liu, Pengfei Wan, Lin Gao


130
UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation

Hebeizi Li, Benyuan Sun, Yi Yang, Zihao Liang, Zihao Yin, Xiao Sha, Chenliang Wang


131
Generative Visual Chain-of-Thought for Image Editing

Zijin Yin, Tiankai Hang, Yiji Cheng, Shiyi Zhang, Runze He, Yu Xu, Chunyu Wang, Bing Li, Zheng Chang, Kongming Liang, Qinglin Lu, Zhanyu Ma


132
UniLayDiff: A Unified Diffusion Transformer for Content-Aware Layout Generation

Zeyang Liu, Le Wang, Sanping Zhou, Yuxuan Wu, Xiaolong Sun, Gang Hua, Haoxiang Li


133
Blend-Aware Latent Diffusion: Mitigating Stitched Seams in Image Inpainting

Yunpeng Liu, Xingzhong Hou, Jie Wu, Boxiao Liu, Yi Zhang, Guanglu Song, Yu Liu, Changyao Tian, Gen Luo, Haihang You


136
SwiftPie: Lightning-fast Subject-driven Image Personalization via One step Diffusion

Huy Duong, Trong-Tung Nguyen, Cuong Pham, Anh Tran, Khoi Nguyen, Minh Hoai


137
Video Generation Models are Good Latent Reward Models

Xiaoyue Mi, Wenqing Yu, Jiesong Lian, Shibo Jie, Ruizhe Zhong, Zijun Liu, Guozhen Zhang, Zixiang Zhou, Zhiyong Xu, Yuan Zhou, Qinglin Lu, Fan Tang


139
VeCoR — Velocity Contrastive Regularization for Flow Matching

Zong-Wei Hong, Jing-Lun Li, Lin-Ze Li, Shen Zhang, Yao Tang


140
CETCam: Camera-Controllable Video Generation via Consistent and Extensible Tokenization

Zelin Zhao, Xinyu Gong, Bangya Liu, Ziyang Song, Jun Zhang, Suhui Wu, Yongxin Chen, Hao Zhang


142
Fashion130K: An E-commerce Fashion Dataset for Outfit Generation with Unified Multi-modal Condition

Yu He, Ting Zhu, Yichun Liu, Lichen Ma, Xinyuan Shan, Jingling Fu, Yu Shi, Junshi Huang, Yan Li


144
DebFilter: Eradicating Biases Stashed in Value

Seung Hyuk Lee, Songkuk Kim


146
Prompt-Guided Image Editing with Masked Logit Nudging in Visual Autoregressive Models

Amir El-Ghoussani, Marc Hölle, Gustavo Carneiro, Vasileios Belagiannis


147
Pioneering Perceptual Video Fluency Assessment: A Novel Task with Benchmark Dataset and Baseline

Qizhi Xie, Kun Yuan, Yunpeng Qu, Ming Sun, Chao Zhou, Jihong Zhu


148
Adapting Large VLMs with Iterative and Manual Instructions for Generative Low-light Enhancement

Xiaoran Sun, Liyan Wang, Yeying Jin, Kin-man Lam, Zhixun Su, Yang Yang, Jinshan Pan, Cong Wang


149
Beyond Pixel Loss: Video-INRs Prefer Perceptual Optimization

Junqi Shi, Wuyang Cong, Ming Lu, Bowei Xu, Zhan Ma


152
FLAIR: Frequency- and Locality-Aware Implicit Neural Representations

Sukhun Ko, Seokhyun Youn, Dahyeon Kye, Kyle Min, Chanho Eom, Jihyong Oh


153
CtrlISP: Rescuing Low-Light RAW Images via Controllable Neural ISP

Chi Zhang, Yachun Li, Hang Du, Shicai Yang, Di Xie, Jiang Zhu, Yang Yang


154
Deepfake-Agent: Aggregating Semantic Forgery Clues for Generalizable Detection

Xiao Guo, Yue Zhang, Mohit Bansal, Xiaoming Liu


155
How far have we gone in Generative Image Restoration? A study on its capability, limitations and evaluation practices

Xiang Yin, Jinfan Hu, Zhiyuan You, Kainan Yan, Yu Tang, Chao Dong, Jinjin Gu


156
PCSTracker: Long-term Scene Flow Estimation for Point Cloud Sequences

Min Lin, Gangwei Xu, Xianqi Wang, Yuyi Peng, Xin Yang


157
POS-ISP: Pipeline Optimization at the Sequence Level for Task-aware ISP

Jiyun Won, Heemin Yang, Woohyeok Kim, Jungseul Ok, Sunghyun Cho


159
Linear Recurrent Unit with Semantic Modulation for Image Super-Resolution

Mingyu Choi, Woo Kyoung Han, Sunghoon Im, Kyong Hwan Jin


160
RodNet: Visual Pathway-Inspired Adaptive Sparse Network for Efficient Low-Light Image Enhancement

Boheng Liu, Ziyu Li, Zhong Zhang, Mengrui Xu, Chenghua Duan, Dehao Liu, Qing Li, Xia Wu


161
LWTformer: A Detail-Aware, Learnable Wavelet-Transformer for Ancient Chinese Character Image Restoration

Wentao Ruan, Xinhui Li, Zhan Cheng, Cunhang Fan, Libao Tian, Zhao Lv


162
SAT: Selective Aggregation Transformer for Image Super-Resolution

Dinh Phu Tran, Thao Do, Saad Wazir, Seongah Kim, Seon Kwon Kim, Daeyoung Kim


163
PhyFusion: Physics-Aware Infrared and Visible Image Fusion via Modality-Specific Physical Priors

Haiyang Jiang, Huiqin Zhang, Yanduo Zhang, Jiayi Ma, Junjun Jiang, Huabing Zhou


164
UnfoldIR: Rethinking Deep Unfolding Network in Illumination Degradation Image Restoration

Chunming He, Rihan Zhang, Fengyang Xiao, Chengyu Fang, Longxiang Tang, Rui Zhang, Sina Farsiu


165
Evaluating Low-Light Image Enhancement Across Multiple Intensity Levels

Maria Pilligua, David Serrano-Lozano, Pai Peng, Ramon Baldrich, Michael S. Brown, Javier Vazquez-Corral


166
FALCON: Fast Adaptive Lightweight Computation of Intensities and Events for Depth Estimation

Sankarshana Venugopal, Mohammad Mostafavi, Jonghyun Choi


167
Learning to Translate Noise for Robust Image Denoising

Inju Ha, Donghun Ryou, Seonguk Seo, Bohyung Han


168
QDM: Quadtree-Based Region-Adaptive Sparse Diffusion Models for Efficient Image Super-Resolution

Donglin Yang, Paul Vicol, Xiaojuan Qi, Renjie Liao, Xiaofan Zhang


169
AlignVAR: Towards Globally Consistent Visual Autoregression for Image Super-Resolution

Cencen Liu, Dongyang Zhang, Wen Yin, Jielei Wang, Tianyu Li, Ji Guo, Wenbo Jiang, Guoqing Wang, Guoming Lu


170
Optical Tolerance-Compensated Diffusion Model for Image Restoration

Hongji Dong, Huihui Gong, Tanli Zuo, Yu Zhao, Jin Dai, Jingduo Tian, Kai Ni


171
TinySR: Shallow Diffusion Transformers for Real-World Image Super-Resolution

Linwei Dong, Qingnan Fan, Yuhang Yu, Qi Zhang, Jinwei Chen, Yawei Luo, Changqing Zou


173
DenoiseGS: Gaussian Reconstruction Model for Burst Denoising

Yongsen Cheng, Yuanhao Cai, Yulun Zhang


174
FlowSteer: Conditioning Flow Field for Consistent Image Restoration

Tharindu Wickremasinghe, Chenyang Qi, Harshana Weligampola, Zhengzhong Tu, Stanley H. Chan


175
P^2CS: Parallel Point Cloud Pre-Training with Semantic Consistency

Linshuang Diao, Sensen Song, Yuan Jia, Yurong Qian, Dayong Ren


176
Towards Calibrated Gradient-based Multi-Task Learning

Linxiao Cao, Mianzimei Yang, Zhipeng Zhou, Hong Xie, Defu Lian, Menglin Yang


177
Brain-Inspired Multimodal Spike Neural Network for Image-Text Retrieval

Xintao Zong, Wenxuan Liu, Jianhao Ding, Zhaofei Yu, Xian Zhong, Tiejun Huang


178
Conformal Cross-Modal Active Learning

Huy Hoang Nguyen, Cédric Jung, Shirin Salehi, Tobias Glück, Anke Schmeink, Andreas Kugi


181
Rethinking Whole-Body CT Image Interpretation: An Abnormality-Centric Approach

Ziheng Zhao, Lisong Dai, Ya Zhang, Weidi Xie, Yanfeng Wang


182
Generative Vision-Language Multiple Instance Learning for Weakly Supervised Neonatal Fundus Screening and Reporting

Xiao Zhang, Guangshuang Tan, Jie Hu, Shichao Kan, Bing Jiang, Yixiong Liang


183
Mitigating Batch Effects in Histopathology via Language-Mediated Robust Embedding Generation

Yishu Zhang, Shushan Wu, Zhenzhong Zhang, Didong Li, Huaxiu Yao, Yun Li, Iain Carmichael, Katherine A Hoadley, Hongtu Zhu, Di Wu, Daiwei Zhang


185
Learning from Noisy Prompts: Saliency-Guided Prompt Distillation for Robust Segmentation with SAM

Jingxuan Kang, Ziqi Zhang, Shaoming Zheng, Shuang Li, Uday Bharat Patel, Alexander Harry Fitzhugh, Phillip Lung, Yusuf Kiberu, Nikesh Jathanna, Shahnaz Jamil-Copley, Bernhard Kainz, Chen Qin


186
Towards Noise-Robust Medical Segmentation via Chebyshev-Attention-Based Asymmetric UNet

Yue Xin, Ziyang Zheng, Wenrui Dai, Chenglin Li, Junni Zou, Hongkai Xiong


189
DepthScopy: Decoupling Frequency for Endoscopic Depth Estimation in Sparsely-Textured Regions

Minghai Shi, Xiaoxian Zhang, Xiaoyue Liu, Fan Yang, Lei Li


190
ReCliFF: Adaptive Orthogonal Decoupling for Federated Fine-tuning of Medical MLLMs

Yuncheng Jiang, Chun-Mei Feng, Rui Sun, Le Zhang


191
Volumetrically Consistent Implicit Atlas Learning via Neural Diffeomorphic Flow for Placenta MRI

Athena Taymourtash, S Mazdak Abulnaga, Esra Abaci-Turk, P Ellen Grant, Polina Golland


192
Vision-Language Models for Automated 3D PET/CT Report Generation

Wenpei Jiao, Ke Yan, Jiajin Zhang, Dakai Jin, Zhaoheng Xie


193
PaM-MIL: Proliferation and Metastasis Enhanced Localization for Multiple Instance Learning on Pathology Images

Pengyu Guo, Jiachuan Wang, Zhao CHEN, Caleb Chen Cao, Liping Wang, Tingyi Jiang, Lei Chen


194
Surgical Procedural Planning as 3D World Modelling: Towards Automated Pulmonary Resection

Zhen Zhang, Zhaorong Dong, Xiao Yang, Liqin Huang, Qiang Wu, Taidui Zeng, Hanyu Zheng, Mingjing Yang, Shaohua Zheng, Wangbin Ding, Lin Pan


195
From Adaptation to Generalization: Adaptive Visual Prompting for Medical Image Segmentation

Evren Çetinkaya, Sangmin Lee, Jung Uk Kim, Hong Joo Lee, Nassir Navab


196
AceMIL: Ordinal-Aware Multiple Instance Learning for Pathological Progression Analysis

Shijie Li, Yiming Chen, Yingyun Gong, Hongwen Zhou, Feng-Jung Chen, Xieping Gao, Zhineng Chen


198
Anatomy-CoT: Teaching MLLMs to Reason in Radiology

Shengzhi Wang, Kai Wu, Lei Yang, Yiwen Ye, Zihan Wang, Yuhang Wu, Mingliang Xiong, Wen Fang, Mingqing Liu, Mengyuan Xu, Hao Deng, Gang Li, Haihua Yang, Qingwen Liu


199
DELRER: Disease Evolution-Informed Longitudinal Radiology Report Generation

Kaiyu Wang, Bing Wang, Changchun Li, You Lu, Yaning Wang, Huimao Zhang, Ximing Li


201
DynaMind: Reconstructing Dynamic Visual Scenes from EEG by Aligning Temporal Dynamics and Multimodal Semantics to Guided Diffusion

Junxiang Liu, Junming Lin, Jie Zhou, Wei Xiong, Jiangtong Li, Jie Li, Jie Zhuang, Hongfei Ji


205
M^3D-BFS: a Multi-Stage Dynamic Fusion Strategy for Sample-Adaptive Multi-Modal Brain Network Analysis

Rui Dong, Xiaotong Zhang, Jiaxing Li, Yueying Li, Jiayin Wei, Youyong Kong


206
Multimodal Decoupled Dynamic Graph Learning for Brain Disease Diagnosis

Aimei Dong, Yongxing Cai, Bin Liu, Jiale Sun, Guixin Zhao


207
TICON: A Slide-Level Tile Contextualizer for Histopathology Representation Learning

Varun Belagali, Saarthak Kapse, Pierre Marza, Srijan Das, Zilinghan Li, Sofiène Boutaj, Pushpak Pati, Srikar Yellapragada, Tarak Nath Nandi, Ravi K Madduri, Joel Saltz, Prateek Prasanna, Stergios Christodoulidis, Maria Vakalopoulou, Dimitris Samaras


208
TP-Seg: Task-Prototype Framework for Unified Medical Lesion Segmentation

Jiawei Xu, Qiangqiang Zhou, Dandan Zhu, Yong Chen, Yugen Yi, Xiaoqi Zhao


211
Learning Spatial-Preserving Hierarchical Representations for Digital Pathology

Weiyi Wu, Xingjian Diao, Chunhui Zhang, Chongyang Gao, Xinwen Xu, Siting Li, Jiang Gui


214
Do Vision Models Perceive Illusory Motion in Static Images Like Humans?

Isabella E. Rosario, Fan L. Cheng, Zitang Sun, Nikolaus Kriegeskorte


217
A Denoising-Enhanced Multimodal Learning Framework for Robust Nasal Endoscopy Report Generation

Xinpan Yuan, Mingzhu Huang, Liujie Hua, Jianuo Ju, Xiaowei Zhao, Lin Yuanbo Wu


218
When Models Learn to Ask Why: Adaptive Causal Reasoning for Trustworthy Medical Vision–Language Models

Jianxin Lin, Chunzheng Zhu, Peter J Kneuertz, Yunfei Bai, Yuan Xue


219
PBSBench: A Multi-Level Vision-Language Framework and Benchmark for Hematopathology Whole Slide Image Interpretation

Yuanlong Wang, Weichi Chen, Adrian Rajab, Wenfang Liu, Yulan Jin, Andrew Srisuwananukorn, Ping Zhang


220
Gated Differential Linear Attention: A Linear-Time Decoder for High-Fidelity Medical Segmentation

Hongbo Zheng, Afshin Bozorgpour, Dorit Merhof, Minjia Zhang


221
Vision-Language Models Encode Clinical Guidelines for Concept-Based Medical Reasoning

Mohamed Harmanani, Bining Long, Zhuoxin Guo, Paul F.R. Wilson, Amirhossein Sabour, Minh Nguyen Nhat To, Gabor Fichtinger, Purang Abolmaesumi, Parvin Mousavi


223
Elicit and Enhance: Advancing Multimodal Reasoning in Medical Scenarios

Zhongzhen Huang, Linjie Mu, Yannian Gu, Kangzhe Hu, Shengyi Hua, Xiaofan Zhang


228
Learning Priors via Hybrid Visual Autoregressive Modeling for Medical Image to Image Translation

Zhaohu Xing, Hongqiu Wang, Tian Ye, Sixiang Chen, Wenxue Li, Lihao Liu, Shuaibo Li, Lei Zhu


229
BLEG: LLM Functions as Powerful fMRI Graph-Enhancer for Brain Network Analysis

Rui Dong, Zitong Wang, Jiaxing Li, Weihuang Zheng, Youyong Kong


230
RelativeFlow: Taming Medical Image Denoising Learning with Noisy Reference

Yuxin Liu, Yiqing Dong, Wenxue Yu, Zhan Wu, Rongjun Ge, Yang Chen, Yuting He


231
UGLMM: Towards Unified Vision Grounding with Large Multimodal Model

Xiangheng Shan, Li Zhou, Zenghui Sun, Shichao Dong, Nong Sang, Jinsong Lan, Xiaoyong Zhu, Bo Zheng, Changxin Gao, Kaifu Zhang


232
FIRE-CIR: Fine-grained Reasoning for Composed Fashion Image Retrieval

François Gardères, Camille-Sovanneary Gauthier, Jean Ponce, Shizhe Chen


234
CREM: Compression-Driven Representation Enhancement for Multimodal Retrieval and Comprehension

Lihao Liu, Biao Yang, Yan Wang, Da Li, Jiangxia Cao, Yuxiao Luo, Xiang Chen, Xiangyu Wu, Wei Yuan, Fan Yang, Guiguang Ding, Tingting Gao, Guorui Zhou


237
LlamaRG: A Multi-View Large Language Model for Radiology Report Generation

Tanuja Jayas, Aditya Rastogi, Pavithra Raghavan, Gianluca Brugnara, Kai Schlamp, Martha Foltyn-Dumitru, Philipp Vollmuth


239
InternVL-X: Advancing and Accelerating InternVL Series with Efficient Visual Token Compression

Dongchen Lu, Zilu Zhang, Leping Huang, Yuyao Sun, Jianliang Zeng, Mao Shu, Huo Cao


240
R²MoE: Representation and Expert Selection Dual-Regularized Mixture-of-Experts for Multimodal Clinical Data

Wajih Hassan Raza, Mya Schiess, Juan Martinez Lemus, Timothy Michael Ellmore, Charles Green, Claudio Soto, Xin Fu, Renjie Hu


241
DUALVISION: RGB–Infrared Multimodal Large Language Models for Robust Visual Reasoning

Abrar Majeedi, Zhiyuan Ruan, Ziyi Zhao, Hongcheng Wang, Jianglin Lu, Yin Li


242
Parallel In-context Learning for Large Vision Language Models

Shin'ya Yamaguchi, Daiki Chijiwa, Tamao Sakao, Taku Hasegawa


243
Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning

Yufei Zhan, Yousong Zhu, Hongyin Zhao, Fan Yang, Shurong Zheng, Ming Tang, Jinqiao Wang


244
Prototype and Sample Level Semantic Alignment for Incomplete Multi-View Clustering

Zhengzhong Zhu, Pei Zhou, Lanxi Bai, Jia Nie, Li Cheng, Shiquan Min, Jiangping Zhu


245
Rethinking VLMs for Image Forgery Detection and Localization

Shaofeng Guo, Jiequan Cui, Richang Hong


246
DiFlowDubber: Discrete Flow Matching for Automated Video Dubbing via Cross-Modal Alignment and Synchronization

Ngoc-Son Nguyen, Thanh V. T. Tran, Jeongsoo Choi, Hieu-Nghia Huynh-Nguyen, Truong-Son Hy, Van Nguyen


247
OTPrune: Distribution-Aligned Visual Token Pruning Via Optimal Transport

Xiwen Chen, Wenhui Zhu, Gen Li, Xuanzhao Dong, Yujian Xiong, Hao Wang, Peijie Qiu, Qingquan Song, Zhipeng Wang, Shao Tang, Yalin Wang, Abolfazl Razi


249
Materialistic RIR: Material Conditioned Realistic RIR Generation

Mahnoor Fatima Saad, Sagnik Majumder, Kristen Grauman, Ziad Al-Halah


250
From Coarse to Precise: Rethinking and Bridging Localization in Multimodal Large Language Models

Lysa Xiao, Veronica Liesaputra, Lech Szymanski, Stephen Cranefield


251
Do Audio-Visual Large Language Models Really See and Hear?

Ramaneswaran Selvakumar, Kaousheik Jayakumar, S Sakshi, Sreyan Ghosh, Ruohan Gao, Dinesh Manocha


252
DraCo: Draft as CoT for Text-to-Image Preview and Rare Concept Generation

Dongzhi Jiang, Renrui Zhang, Haodong Li, Zhuofan Zong, Ziyu Guo, Jun He, Claire Guo, Junyan Ye, Rongyao Fang, Weijia Li, Rui Liu, Hongsheng Li


253
FastMMoE: Accelerating Multimodal Large Language Models through Dynamic Expert Activation and Routing-Aware Token Pruning

Guoyang Xia, Yifeng Ding, Fengfa Li, Lei Ren, Wei Chen, Fangxiang Feng, Xiaojie Wang


254
Anticipatory Planning for Multimodal AI Agents

Yongyuan Liang, Shijie Zhou, Yu Gu, Hao Tan, Gang Wu, Franck Dernoncourt, Jihyung Kil, Ryan A. Rossi, Ruiyi Zhang


255
Quantifying the Gap between Understanding and Generation within Unified Multimodal Models

Chenlong Wang, Yuhang Chen, Zhihan Hu, Dongping Chen, Wenhu Chen, Sarah Wiegreffe, Tianyi Zhou


257
Concise Geometric Description as a Bridge: Unleashing the Potential of LLM for Plane Geometric Problem Solving

Jingyun Wang, Dian Li, Xiaohan Wang, Gang Liu, Jiahong Yan, Guoliang Kang


258
HippoMM: Hippocampal-inspired Multimodal Memory for Long Audiovisual Event Understanding

Yueqian Lin, Jingyang Zhang, Qinsi Wang, Hancheng Ye, Yuzhe Fu, Yudong Liu, Hai Helen Li, Yiran Chen


260
HoliSafe: Holistic Safety Benchmarking and Modeling for Vision-Language Model

Youngwan Lee, Kangsan Kim, Kwanyong Park, Ilchae Jung, Soojin Jang, Seanie Lee, Yong-Ju Lee, Sung Ju Hwang


261
UMI-HOI: Unifying Multimodal Information with Semantic Multi-Head Attention for Human–Object Interaction Detection

Yuankai Wu, Zhinan Li, Constantin Patsch, Marsil Zakour, Driton Salihu, Eckehard Steinbach


266
CLASH: A Benchmark for Cross-Modal Contradiction Detection

Teodora Popordanoska, Jiameng Li, Matthew B. Blaschko


268
HAIT: Hybrid Adversarial Iterative Training for Mitigating Object Hallucination in Large Vision–Language Models

Liangjie Zhao, Liao Wenjie, Ming Feng, Xiaohui Song, Huafei Li, Haonan Lu


271
Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models

Xinpeng Dong, Min Zhang, Kairong Han, Xu Tan, Fei Wu, Kun Kuang


272
PaLMR: Towards Faithful Visual Reasoning via Multimodal Process Alignment

Yantao Li, Chenyang Yan, Qiang Hui, Fang Zhao, Kanzhi Cheng, Chao Tan, Huanlin Gao, Jianbing Zhang, Kai Wang, Xinyu Dai, Shiguo Lian


273
If you can describe it, they can see it: Cross-Modal Learning of Visual Concepts from Textual Descriptions

Carlo Alberto Barbano, Luca Molinaro, Massimiliano Ciranni, Emanuele Aiello, Vito Paolo Pastore, Marco Grangetto


274
LiteEmbed: Adapting CLIP to Rare Classes

Aishwarya Agarwal, Srikrishna Karanam, Vineet Gandhi


275
CADReasoner: Iterative Program Editing for CAD Reverse Engineering

Soslan Kabisov, Vsevolod Kirichuk, Andrey Volkov, Marina Barannikov, Gennadiy Savrasov, Anton Konushin, Andrey Kuznetsov, Dmitrii Zhemchuzhnikov


277
Perturb and Recover: Fine-Tuning for Effective Backdoor Removal from CLIP

Naman Deep Singh, Francesco Croce, Matthias Hein


279
Scaling Pre-training to One Hundred Billion Data for Vision Language Models

Xiao Wang, Ibrahim Alabdulmohsin, Daniel Salz, Zhe Li, Keran Rong, Xiaohua Zhai


280
HAFM: A Post-Fusion Gating Module for Haze-Aware RGB–Thermal Object Detection

Juan M. Saeteros, Nick J. Arévalo, Boris X. Vintimilla


281
CaptAin: Caption-driven Alignment for Bridging Modality Gaps in Partially Relevant Video Retrieval

Chuanshen Chen, Kai Zhou, Feiqi Wang, Yutao Ning, Zhendong Xiong, Yirui Li, Zhiquan Wen, Mingkui Tan


283
HeartcareGPT: A Unified Multimodal ECG Suite for Dual Signal–Image Modeling and Understanding

Yihan Xie, Sijing Li, Zhuonan Wang, Tianwei Lin, Chenglin Yang, Yu Zhong, Wenjie Yan, Wenqiao Zhang, Xiaogang Guo, Jun Xiao, Yueting Zhuang, Beng Chin Ooi


284
Unbiased Dynamic Multimodal Fusion

Shicai Wei, Kaijie Zhang, Luyi Chen, Tao He, Guiduo Duan


285
Video Reasoning Without Training

Deepak Sridhar, Kartikeya Bhardwaj, Jeya Pradha Jeyaraj, Nuno Vasconcelos, Ankita Nayak, Harris Teague


286
Efficient Discrete Diffusion Model for Scalable Multi-Objective Traveling Salesman Problem

Dawei Su, Zhanhong Fang, Junyi Luo, Debing Wang, Jinbiao Chen, Zizhen Zhang


288
S³O: Selective Spatial-Spectral Operator for Cross-Scale Fusion

Jieyuan Pei, Wei Li, Zhuoxuan Li, Junwei Zhu, Meiyi Lu, Jiawei Jiang, Chenyu Wang, Jianwei Zheng


289
Fast Kernel-Space Diffusion for Remote Sensing Pansharpening

Hancong Jin, Zihan Cao, Liang-Jian Deng, Jingjing Li


290
Unified Urban Tuning: Co-Enhancing Satellite and Street View Reasoning with a Progressive Tuning Framework

Yong Li, Weiyu Zhang, Ling Dai, Jian Yang, Dacheng Yin, Sirun Li, Jing Lyu, Fengyun Rao, Fan Zhang


291
GReD-RSITR: A Generative Re-Examined Discriminative Framework for Remote Sensing Image-Text Retrieval

Shuhuai Wang, Songwei Pei, Bingfeng Liu, Yuanzhou Huang, Qian Li, Shangguang Wang


293
Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization

Yuqi Chen, Xiaohan Zhang, Ahmad Arrabi, Waqas Sultani, Chen Chen, Safwan Wshah


294
Optimal-Transport-based Feature Alignment for Multimodal Change Detection

Mengqi Huang, Jun Liu, Li Cui, Yuping Duan, Faqiang Wang


295
HarmoniDiff-RS: Training-Free Diffusion Harmonization for Satellite Image Composition

Xiaoqi Zhuang, Jefersson A Dos Santos, Jungong Han


296
CrossWeaver: Towards Efficient Cross-Modal Interweaving and Decoupling for Weakly-Aligned Multispectral Object Detection

Haitian Yang, Juan Fang, Yiren Zhu, Xudong Zhao, Yufei Guo, Xiaohan Zhang, Xiaoxing Hu, Xue Yang, Qi Ming


297
ProSM: Progressive Soft Masking for Fine-Grained Remote Image Segmentation

Bingkun Nian, Fenghe Tang, Zhiwei Ning, Dongsheng Jiang, Yin Li, JIE Yang, Rong Xiao, Shaohua Kevin Zhou, Wei Liu


298
UniD-Shift: Towards Unified Semantic Segmentation via Interpretable Shared–Private Multimodal Decomposition

Shuai Zhang, Zhecheng Shi, Zhuoxiao Li, Jing Ou, Tengxi Wang, Yuan Liu, Wufan Zhao


300
M-PhyGs: Multi-Material Object Dynamics from Video

Norika Wada, Kohei Yamashita, Ryo Kawahara, Ko Nishino


301
Diffusion^2: Turning 3D Environments into Radio Frequency Heatmaps

Kyoungjun Park, Yifan Yang, Changhan Ge, Lili Qiu, Shiqi Jiang


302
Controllable Radar Simulation with Waveform Parameter Embedding

Weiqing Xiao, Hao Huang, Chonghao Zhong, Yujie Lin, Nan Wang, Xiaoxue Chen, Zhaoxi Chen, Saining Zhang, Shuocheng Yang, Pierre Merriaux, Lei Lei, Hao Zhao


304
GLOW: Global Illumination-Aware Inverse Rendering of Indoor Scenes Captured with Dynamic Co-Located Light & Camera

Jiaye Wu, Saeed Hadadan, Geng Lin, Peihan Tu, Matthias Zwicker, David Jacobs, Roni Sengupta


306
How to Achieve Prototypical Birth and Death for OOD Detection?

Ningkang Peng, Qianfeng Yu, Xiaoqian Peng, Linjing Qian, Yafei Liu, Canran Xiao, Xinyu Lu, Tingyu Lu, Zhichao Zheng, Yanhui Gu


308
EIRES:Training-free AI-Generated Image Detection via Edit-Induced Reconstruction Error Shift

Wan Jiang, Jing Yan, Xiaojing Chen, Ling Shen, Chenhao Lin, Yunfeng Diao, Richang Hong


309
Vote-in-Context: VLMs as Explainable Zero-Shot Rank Fusers

Mohamed Eltahir, Ali Habibullah, Lama Ayash, Tanveer Hussain, Naeemullah Khan


310
PRADA: Probability-Ratio-Based Attribution and Detection of Autoregressive-Generated Images

Simon Damm, Jonas Ricker, Henning Petzka, Asja Fischer


313
DSAA: Dual-Stage Attribute Activation for Fine-Grained Open Vocabulary Detection

Donghong Jiang, Endian Lin, Hanqing Liu, Mingjie Liu, Luoping Cui, Zhao Yang, Chuang Zhu


314
ConSel: Concept-Aware Self-supervised Learning for Regression Beyond Ordinal Tasks

Abdullah Tariq, Bisma Saleem, R Muhammad Atif Azad, Martin Masek, Syed Zulqarnain Gilani


317
SFS-DETR: Spatial-Frequency Selection for UAV Object Detection

Dingding Jia, Jiankang Wang, Longlong Zhang, Zhiheng Liu, Xuan Wang


318
ForenDeX: Unlocking Forensic Insights for Explainable AI-Generated Image Detection

Chuangchuang Tan, Jinglu Wang, Xiang Ming, Renshuai Tao, Yunchao Wei, Yao Zhao, Yan Lu


319
Long-Tailed Out-of-Distribution Detection with Refined Separate Class Learning

Shuai Feng, Yuxin Ge, Baoming Zhang, Yuntao Du, MingCai Chen, Chongjun Wang, Lei Feng