NeurIPS 2026 · Accepted

Revisiting Diffusion Fine-Tuning for Unsupervised Domain Adaptation

MUSE — Multi-target UDA-oriented Synthesis with Efficient diffusion fine-tuning

Xuan Qi, Yi Wei, Daniele Berardini, Vito Paolo Pastore, Vittorio Murino

Istituto Italiano di Tecnologia (IIT) · University of Genoa · Nanjing University

Overview

MUSE reformulates diffusion-based UDA for the multi-target setting: instead of repeating source–target fine-tuning for every target domain, a single source-guided diffusion adaptation process is shared across multiple unlabeled targets.

01

Problem

Existing diffusion-based UDA pipelines are typically target-specific, requiring a separate source–target fine-tuning process for each target domain.

02

Shared–Private Adaptation

MUSE separates source-supervised semantics from target-specific appearance using a shared semantic branch and lightweight target-private style cores.

03

Target-specific Generation

After multi-target fine-tuning, MUSE activates the corresponding target branch to generate labeled target-style bridge samples for downstream UDA.

Goal. Improve the accuracy–efficiency trade-off by sharing reusable semantic adaptation while preserving target-specific visual variation.

MUSE Pipeline

Shared

Semantic branch

Labeled source images use class-conditional prompts and update a shared low-rank semantic branch.

Private

Target style cores

Each target activates only its lightweight private core on top of shared style projection factors.

Two-pass

Decoupled optimization

Pass A updates semantics from source data; Pass B freezes semantics and updates target-conditioned style parameters.

Adaptive

Target sampling

Targets with larger recent denoising losses receive more target-side updates during multi-target adaptation.

Overview of the MUSE pipeline with frozen SDXL components, shared-private adapters, source-conditioned and target-conditioned passes, and adaptive target sampling.
MUSE performs branch-decoupled diffusion adaptation with a source-supervised shared semantic branch and target-private style branches, then activates the corresponding target branch for target-specific bridge generation.

Target-specific Bridge Generation

1. DDIM inversion translation

Instance-preserving bridge: invert a labeled source image and denoise it with a target-specific branch. The generated sample keeps the source label while shifting visual appearance toward the target domain.

2. Class-conditional generation

Diversity bridge: start from Gaussian noise and use class prompts with the target-specific branch to synthesize additional labeled target-style samples.

Bridge generation examples on miniDomainNet using DDIM inversion and Gaussian-noise class-conditional synthesis.
Bridge generation on miniDomainNet: DDIM inversion translates a Real-domain lion to Clipart, Painting, and Sketch; Gaussian-noise class-conditional generation synthesizes broccoli in target styles.

miniDomainNet Results

miniDomainNet uses Clipart (C), Painting (P), Real (R), and Sketch (S), producing twelve ordered transfer tasks. Values below are target-domain top-1 accuracy (%). Pairwise methods adapt/generate separately for source–target pairs, while MUSE uses multi-target generation.

84.37%SSRT + MUSE average
64.02%MCC + MUSE average
65.04%ELS + MUSE average
2.44×SDXL fine-tuning speedup vs. Terra
MethodDiffusion Gen. C→PC→RC→S P→CP→RP→S R→CR→PR→S S→CS→PS→RAvg.
ERM—39.4853.2742.9349.5568.1841.9949.3055.5237.3554.6045.3353.0849.22
DANN—45.9456.1249.4050.7265.6150.0755.1560.5549.9558.5454.6458.9954.64
AFN—49.2360.1151.1155.6070.5951.7855.8460.4147.4660.6956.3662.2856.79
CDAN—47.9958.5051.1756.3668.7153.0161.1562.8553.4460.8955.9060.8857.57
MDD—48.5361.7552.3259.7470.6255.4362.1862.2254.0463.0758.5564.5059.41
SDAT—50.9762.4253.9160.5769.9755.8564.3964.8355.8664.0759.4364.2860.55
MCC—51.9567.7352.6660.9676.6154.6764.1564.0250.3463.6459.6869.7861.35
ELS—50.1161.4553.0260.7770.6156.0462.4364.1654.8963.9359.1964.4760.09
SSRT—77.3086.3575.2480.7988.1074.9284.2980.1678.1081.7575.7186.6780.78
Diffusion-based baselines: pairwise generation
MCC + TerraPairwise52.6468.2651.8860.4577.2455.4163.8564.5250.8663.2159.8870.6861.57
ELS + TerraPairwise52.6868.5754.3760.2370.7856.8763.5763.2554.5164.2260.3664.5461.16
SSRT + TerraPairwise79.8489.0576.3580.4888.4175.5682.8478.2578.4080.9577.1488.4181.31
MCC + DCDMPairwise55.2870.2154.4263.2577.0555.7465.1665.0151.9665.7660.8371.0962.98
ELS + DCDMPairwise56.1468.5255.5164.9673.4458.2364.6764.3657.6667.2362.5669.9063.60
SSRT + DCDMPairwise78.2687.4277.5681.6487.1576.8281.9280.3576.5182.3476.9288.2181.26
Our method: multi-target generation
MCC + MUSEMulti-target58.0272.8256.5466.2374.5657.7463.4265.8754.6766.7460.9870.6464.02
ELS + MUSEMulti-target59.1873.6157.1365.8175.8158.6264.3165.3258.9467.5961.9372.2465.04
SSRT + MUSEMulti-target80.6891.1680.0585.6091.6379.2585.4481.7980.0584.4980.2192.1184.37

Avg. is over all twelve tasks. SSRT + MUSE obtains the highest value on every reported miniDomainNet transfer task in this table.

Generator fine-tuning efficiency

Dataset# DomainsTerra (h) ↓MUSE (h) ↓Speedup ↑
Office-31396.7851.741.87×
Office-Home4196.3680.792.43×
miniDomainNet4197.6881.042.44×

Feature-space Visualization

The t-SNE plots compare source-domain samples, target-domain samples, DDIM-inversion adapted source samples, and generated target-domain samples across Office-31, Office-Home, and miniDomainNet.

t-SNE visualizations for Office-31, Office-Home, and miniDomainNet comparing source, target, DDIM-inversion adapted source, and generated target samples.
Representative feature-space visualizations on Office-31, Office-Home, and miniDomainNet.

Citation

@inproceedings{qi2026muse,
  title={Revisiting Diffusion Fine-Tuning for Unsupervised Domain Adaptation},
  author={Qi, Xuan and Wei, Yi and Berardini, Daniele and Pastore, Vito Paolo and Murino, Vittorio},
  booktitle={Advances in Neural Information Processing Systems},
  year={2026}
}