ArXiv

Motion-Conditioned Multi-View Fusion for Myocardial Infarction Localization from Echocardiography

Authors
Guang Yang, Wentian Xu, Siyu Wang...
Categories
cs.CV
arXiv
https://arxiv.org/abs/2607.15268v1
PDF
https://arxiv.org/pdf/2607.15268v1

Brief

MCF-Net is a motion-guided multi-view fusion framework for localizing myocardial infarction from echocardiography. It uses a pretrained EchoPrime foundation model across dual views and models cardiac motion with only a single annotated template frame to initialize point tracking. Motion-derived segment-aware soft masks and a motion-conditioned fusion module improve segment-level localization, yielding 72.4% F1 and 84.9% accuracy, surpassing motion-only, vision-only, and prior fusion methods.

Why it matters

MCF-Net achieves 72.4% F1 and 84.9% accuracy for segment-level myocardial infarction (MI) localization, outperforming motion-only, vision-only, and prior fusion baselines on echocardiography.

Key details

  • MCF-Net fuses EchoPrime foundation-model visual features from dual views with motion cues derived from extremely sparse supervision (a single annotated template frame for point tracking); motion-derived segment-aware soft masks and a motion-conditioned fusion module address view-dependent ambiguity (notably apical views).
Cleaned source text

Abstract