Skip to content

Pretrained SAE Models

GPT-2 Small (Layer 3)

  • Architecture: TopK SAE
  • Weight Tying: Yes
  • Hidden Size: 24,576
  • Non-zero Fraction: 3%
  • Training Dataset: 1.1M Activations
  • Context Window: 1,024
  • Eval Loss: 0.06

Download Model Download Config

GPT-2 Small (Layer 3)

  • Architecture: TopK SAE
  • Weight Tying: No
  • Hidden Size: 24,576
  • Non-zero Fraction: 3%
  • Training Dataset: 1.1M Activations
  • Context Window: 1,024
  • Eval Loss: 0.06

Download Model Download Config

GPT-2 Small (Layer 3)

  • Architecture: TopK SAE
  • Weight Tying: No
  • Hidden Size: 24,576
  • Non-zero Fraction: 3%
  • Training Dataset: 2M Activations
  • Context Window: 1,024
  • Eval Loss: 0.15

Download Model Download Config

GPT-2 Small (Layer 12)

  • Architecture: TopK SAE
  • Weight Tying: No
  • Hidden Size: 24,576
  • Non-zero Fraction: 3%
  • Training Dataset: 1.1M Activations
  • Context Window: 1,024
  • Eval Loss: 0.14

Download Model Download Config

GPT-2 Medium (Last Layer)

  • Architecture: TopK SAE
  • Weight Tying: No
  • Hidden Size: 32,768
  • Non-zero Fraction: 2%
  • Training Dataset: 1.1M Activations
  • Context Window: 1,024
  • Eval Loss: 0.06

Download Model Download Config