ArXiv

Asynchronous Multimodal Diffusion Policy Composition via Latency-Aware Guidance Fusion

Authors
Zihao He, Hongjie Fang, Shirun Tang...
Categories
cs.RO, cs.AI
arXiv
https://arxiv.org/abs/2607.17257v1
PDF
https://arxiv.org/pdf/2607.17257v1

Brief

LAG-Fusion presents a latency-aware approach to asynchronous multimodal diffusion policy composition: modality-specific diffusion policies run at native rates and supply denoising guidance as available, while a derived reference-frame rebasing rule aligns delayed inputs under relative action representations. Applied to contact-rich manipulation (low-frequency vision + high-frequency force), experiments show improved responsiveness and task performance; full text on arXiv.

Why it matters

LAG-Fusion is a latency-aware guidance fusion framework that composes asynchronous multimodal diffusion policies by letting modality-specific policies run at native inference rates and contribute denoising guidance whenever available.

Key details

  • The paper derives a reference-frame rebasing rule for diffusion variables under relative action representations to align delayed modality guidance before fusion (Zihao He et al., arXiv preprint, published 2026-07-19).
  • Instantiated for contact-rich manipulation by composing a low-frequency vision policy with a high-frequency force policy, LAG-Fusion improves policy responsiveness and task performance under heterogeneous modality latencies versus synchronous fusion and force-aware baselines.
Source evidence

Abstract

Diffusion policies have shown strong potential for robotic imitation learning, and recent extensions incorporate additional modalities to improve manipulation performance. However, these modalities often differ not only in information content but also in sensing rates and inference latencies. Existing multimodal diffusion policies typically rely on synchronous fusion or manually designed multi-frequency architectures, which either slow down high-frequency feedback or limit extensibility to new modality combinations. We propose LAG-Fusion, a latency-aware guidance fusion framework for asynchronous multimodal diffusion policy composition. LAG-Fusion allows modality-specific policies to operate at their native inference rates and contribute denoising guidance whenever available. To make asynchronous composition consistent, we derive a reference-frame rebasing rule for diffusion variables under relative action representations, enabling delayed guidance to be aligned before fusion. We instantiate LAG-Fusion in contact-rich manipulation by composing a low-frequency vision policy with a high-frequency force policy. Experiments under heterogeneous modality latencies show that LAG-Fusion improves policy responsiveness and task performance over synchronous fusion and specially designed force-aware baselines.