ArchitectureClassification
2-Layer Binary Classifier
embed → 2× attn → sigmoid head
✓PFN Studio Team
Same backbone as the regression baseline, scalar head emits one logit per point. Paired with the two-moons / GMM priors.
Architecture
tabular_embedder (d=64)transformer_encoder × 2scalar_head (d_out=1)