Building a Multimodal Neural Foundation Model
neuros-neurofm is the architectural centerpiece: neuroFMx, a foundation model built from
scratch to treat heterogeneous neural signals as tokens and learn shared representations across
modalities, subjects, and sessions.
package map
neuros-neurofm — the neuroFMx multimodal foundation model
The from-scratch foundation model: per-modality tokenizers, a Mamba backbone, self-supervised objectives, and parameter-efficient adapters for cross-session transfer.
Tokenize
Tokenizers
spike, LFP, EEG, fMRI, calcium, audio, video, binned
Temporal alignment
common clock across modalities
Model
Mamba backbone + POPT
linear-time sequence + population transformer
neuroFMx heads
single and multitask
Masked-modeling SSL
self-supervised and multitask losses
Adapt
LoRA + unit-ID adapters
cross-session / cross-subject transfer
Model compression
deploy-time optimization
What It Comprises
- Tokenizers — per-modality tokenizers for spikes, LFP, EEG, fMRI, calcium, audio, video, and
binned rates, with a
temporal_alignmentmodule to put them on a common clock. - Backbone — a Mamba state-space backbone for linear-time modeling of long neural
sequences, plus a
poptpopulation transformer. - Models & heads —
neurofmx,neurofmx_complete,neurofmx_multitask, andmultimodal_neurofmx, with single- and multitaskheads. - Objectives — masked-modeling and multitask losses for self-supervised pretraining.
- Adapters — LoRA and unit-ID adapters for parameter-efficient cross-session / cross-subject transfer.
- Deployment —
model_compression, aneuros_adapterintegration, and multimodal training.
How It Differs
neuros-foundation wraps published models; neuros-neurofm is my own model. Its separable
tokenizer, alignment, backbone, adapter, and loss layers are where "combining and building large
multimodal models" becomes concrete, recomposable engineering rather than a slogan.
Part of the neurOS-v1 platform.