Library
- What Machine Learning Is, and Is Not001✓ EXPLORED
What Machine Learning Is, and Is Not
- The Data Is the Model002✓ EXPLORED
The Data Is the Model
- Features and Representations003✓ EXPLORED
Features and Representations
- Loss: How a Model Knows It Is Wrong004✓ EXPLORED
Loss: How a Model Knows It Is Wrong
- Gradient Descent005✓ EXPLORED
Gradient Descent
- Backpropagation006✓ EXPLORED
Backpropagation
- What a Neural Network Actually Computes007✓ EXPLORED
What a Neural Network Actually Computes
- Parameters, Weights, Layers, Activations008✓ EXPLORED
Parameters, Weights, Layers, Activations
- Activations: ReLU, GELU, SwiGLU009✓ EXPLORED
Activations: ReLU, GELU, SwiGLU
- Training Versus Inference010✓ EXPLORED
Training Versus Inference
- Self-Supervised Learning011✓ EXPLORED
Self-Supervised Learning
- Overfitting and Generalisation012✓ EXPLORED
Overfitting and Generalisation
- Residual Connections and Normalisation013✓ EXPLORED
Residual Connections and Normalisation
- Why Scale Worked014✓ EXPLORED
Why Scale Worked
- Why Hand-Built Knowledge Lost015✓ EXPLORED
Why Hand-Built Knowledge Lost
- Turning Text Into Numbers016✓ EXPLORED
Turning Text Into Numbers
- Tokens: How Language Becomes Something a Model Can Process017✓ EXPLORED
Tokens: How Language Becomes Something a Model Can Process
- Byte Pair Encoding018✓ EXPLORED
Byte Pair Encoding
- What Tokenisation Breaks019✓ EXPLORED
What Tokenisation Breaks
- Embeddings: Meaning as Direction020✓ EXPLORED
Embeddings: Meaning as Direction
- Living in 4,096 Dimensions021✓ EXPLORED
Living in 4,096 Dimensions
- Predicting the Next Token022✓ EXPLORED
Predicting the Next Token
- The Recurrent Era and Its Bottleneck023✓ EXPLORED
The Recurrent Era and Its Bottleneck
- One Word, Many Meanings024✓ EXPLORED
One Word, Many Meanings
- Vocabularies, Special Tokens and Chat Templates025✓ EXPLORED
Vocabularies, Special Tokens and Chat Templates
- Attention, Before the Maths026✓ EXPLORED
Attention, Before the Maths
- Queries, Keys and Values027✓ EXPLORED
Queries, Keys and Values
- Self-Attention, Step by Step028✓ EXPLORED
Self-Attention, Step by Step
- Multi-Head Attention029✓ EXPLORED
Multi-Head Attention
- The Causal Mask030✓ EXPLORED
The Causal Mask
- Position: Attention Has No Sense of Order031✓ EXPLORED
Position: Attention Has No Sense of Order
- Rotary Position Embeddings032✓ EXPLORED
Rotary Position Embeddings
- Models Without Positional Encoding033✓ EXPLORED
Models Without Positional Encoding
- The Feedforward Block034✓ EXPLORED
The Feedforward Block
- The Transformer Block, Assembled035✓ EXPLORED
The Transformer Block, Assembled
- The Residual Stream036✓ EXPLORED
The Residual Stream
- Encoder, Decoder, or Both037✓ EXPLORED
Encoder, Decoder, or Both
- Why Attention Gets Expensive038✓ EXPLORED
Why Attention Gets Expensive
- FlashAttention039✓ EXPLORED
FlashAttention
- Multi-Query and Grouped-Query Attention040✓ EXPLORED
Multi-Query and Grouped-Query Attention
- Alternatives to Attention041✓ EXPLORED
Alternatives to Attention
- Logits and the Softmax042✓ EXPLORED
Logits and the Softmax
- Temperature043✓ EXPLORED
Temperature
- Top-k, Top-p and Min-p044✓ EXPLORED
Top-k, Top-p and Min-p
- The Context Window045✓ EXPLORED
The Context Window
- Long Context Is Not Uniform Attention046✓ EXPLORED
Long Context Is Not Uniform Attention
- The KV Cache047✓ EXPLORED
The KV Cache
- Prefill Versus Decode048✓ EXPLORED
Prefill Versus Decode
- Batching, Throughput and Latency049✓ EXPLORED
Batching, Throughput and Latency
- Speculative Decoding050✓ EXPLORED
Speculative Decoding
- Constrained and Structured Generation051✓ EXPLORED
Constrained and Structured Generation
- System Prompts and Instruction Hierarchy052✓ EXPLORED
System Prompts and Instruction Hierarchy
- Pretraining053✓ EXPLORED
Pretraining
- What Goes Into the Corpus054✓ EXPLORED
What Goes Into the Corpus
- Chinchilla and Compute-Optimal Training055✓ EXPLORED
Chinchilla and Compute-Optimal Training
- Supervised Fine-Tuning056✓ EXPLORED
Supervised Fine-Tuning
- RLHF057✓ EXPLORED
RLHF
- DPO and Direct Preference Learning058✓ EXPLORED
DPO and Direct Preference Learning
- Training Against Written Principles059✓ EXPLORED
Training Against Written Principles
- LoRA and Parameter-Efficient Fine-Tuning060✓ EXPLORED
LoRA and Parameter-Efficient Fine-Tuning
- Fine-Tune, Prompt, or Retrieve061✓ EXPLORED
Fine-Tune, Prompt, or Retrieve
- Catastrophic Forgetting062✓ EXPLORED
Catastrophic Forgetting
- The Emergent Abilities Argument063✓ EXPLORED
The Emergent Abilities Argument
- Chain of Thought064✓ EXPLORED
Chain of Thought
- Sampling Many Answers065✓ EXPLORED
Sampling Many Answers
- Test-Time Compute066✓ EXPLORED
Test-Time Compute
- Reasoning Models067✓ EXPLORED
Reasoning Models
- Mixture of Experts068✓ EXPLORED
Mixture of Experts
- Dense Versus Sparse Models069✓ EXPLORED
Dense Versus Sparse Models
- Distillation070✓ EXPLORED
Distillation
- Pruning071✓ EXPLORED
Pruning
- Looking Inside the Model072✓ EXPLORED
Looking Inside the Model
- Architectural Limits073✓ EXPLORED
Architectural Limits
- Why GPUs074✓ EXPLORED
Why GPUs
- VRAM: The Number That Decides Everything075✓ EXPLORED
VRAM: The Number That Decides Everything
- Bandwidth, Not FLOPs076✓ EXPLORED
Bandwidth, Not FLOPs
- Unified Memory077✓ EXPLORED
Unified Memory
- Quantisation078✓ EXPLORED
Quantisation
- GPTQ, AWQ and K-Quants079✓ EXPLORED
GPTQ, AWQ and K-Quants
- Model Formats: GGUF, Safetensors, MLX080✓ EXPLORED
Model Formats: GGUF, Safetensors, MLX
- Running an Open-Weight Model Locally081✓ EXPLORED
Running an Open-Weight Model Locally
- Why Long Context Eats Your RAM082✓ EXPLORED
Why Long Context Eats Your RAM
- Splitting a Model Across Machines083✓ EXPLORED
Splitting a Model Across Machines
- A Cluster of Personal Computers084✓ EXPLORED
A Cluster of Personal Computers
- Local Versus Cloud, Honestly085✓ EXPLORED
Local Versus Cloud, Honestly
- Embedding Models086✓ EXPLORED
Embedding Models
- Vector Search087✓ EXPLORED
Vector Search
- Retrieval-Augmented Generation088✓ EXPLORED
Retrieval-Augmented Generation
- Chunking and Reranking089✓ EXPLORED
Chunking and Reranking
- Tool Use and Function Calling090✓ EXPLORED
Tool Use and Function Calling
- Agents091✓ EXPLORED
Agents
- Standardised Tool Connections092✓ EXPLORED
Standardised Tool Connections
- Multimodal Models093✓ EXPLORED
Multimodal Models
- Diffusion and Image Generation094✓ EXPLORED
Diffusion and Image Generation
- Speech Recognition and Synthesis095✓ EXPLORED
Speech Recognition and Synthesis
- Hallucination096✓ EXPLORED
Hallucination
- Evaluating Models097✓ EXPLORED
Evaluating Models
- Bias, Harm and Safety Training098✓ EXPLORED
Bias, Harm and Safety Training
- Prompt Injection099✓ EXPLORED
Prompt Injection
- Open Weights, Closed Frontiers100✓ EXPLORED
Open Weights, Closed Frontiers
- Neural Tangent Kernel Analysis101✓ EXPLORED
Neural Tangent Kernel Analysis
- Diffusion Model ODE/SDE Frameworks102✓ EXPLORED
Diffusion Model ODE/SDE Frameworks
- Sparse Mixture of Experts Routing103✓ EXPLORED
Sparse Mixture of Experts Routing
- Transformer Neural Machine Translation104✓ EXPLORED
Transformer Neural Machine Translation
JUNE 2017
- Vision-Language Navigation105✓ EXPLORED
Vision-Language Navigation
- Model-Based Reinforcement Learning with MuZero106✓ EXPLORED
Model-Based Reinforcement Learning with MuZero
- BIG-bench Collaborative Benchmark107✓ EXPLORED
BIG-bench Collaborative Benchmark
- Mechanistic Probes for Circuit Discovery108✓ EXPLORED
Mechanistic Probes for Circuit Discovery
- Blockwise Quantization-Aware Training109✓ EXPLORED
Blockwise Quantization-Aware Training
- Dataset Distillation110✓ EXPLORED
Dataset Distillation
- AI and Neuroscience Cross-Pollination111✓ EXPLORED
AI and Neuroscience Cross-Pollination
- Layer-wise Adaptive Rate Scaling (LARS)112✓ EXPLORED
Layer-wise Adaptive Rate Scaling (LARS)
- vLLM: PagedAttention for LLM Serving113✓ EXPLORED
vLLM: PagedAttention for LLM Serving
- Unified MultiModal Embedding with ImageBind114✓ EXPLORED
Unified MultiModal Embedding with ImageBind
- Hindsight Experience Replay115✓ EXPLORED
Hindsight Experience Replay
- Holistic Evaluation of Language Models (HELM)116✓ EXPLORED
Holistic Evaluation of Language Models (HELM)
- Sparse Autoencoders for Feature Discovery117✓ EXPLORED
Sparse Autoencoders for Feature Discovery
- Sliding Window Attention for Long Sequences118✓ EXPLORED
Sliding Window Attention for Long Sequences
- Web-Scale Text Corpora Curation119✓ EXPLORED
Web-Scale Text Corpora Curation
- Graph Attention Networks120✓ EXPLORED
Graph Attention Networks
- Fourier Features for Positional Encoding121✓ EXPLORED
Fourier Features for Positional Encoding
- Orca: System for Distributed Inference122✓ EXPLORED
Orca: System for Distributed Inference
- Audio-Visual Contrastive Learning123✓ EXPLORED
Audio-Visual Contrastive Learning
- Self-Play with Population-Based Training124✓ EXPLORED
Self-Play with Population-Based Training
- Anthropic's Redwood Research Interpretability125✓ EXPLORED
Anthropic's Redwood Research Interpretability
- TruthfulQA: Measuring Truthfulness126✓ EXPLORED
TruthfulQA: Measuring Truthfulness
- Causal Mediation Analysis in Neural Networks127✓ EXPLORED
Causal Mediation Analysis in Neural Networks
- Activation Sparsity via ReLU Pruning128✓ EXPLORED
Activation Sparsity via ReLU Pruning
- Crowdsourcing High-Quality Human Feedback129✓ EXPLORED
Crowdsourcing High-Quality Human Feedback
- BERT and the Masked Language Modeling Revolution130✓ EXPLORED
BERT and the Masked Language Modeling Revolution
- Stable Diffusion Architecture131✓ EXPLORED
Stable Diffusion Architecture
- Hyperparameter Transfer Learning132✓ EXPLORED
Hyperparameter Transfer Learning
- TensorRT and Kernel Fusion133✓ EXPLORED
TensorRT and Kernel Fusion
- NeRF: Neural Radiance Fields134✓ EXPLORED
NeRF: Neural Radiance Fields
- Mixture of Experts Routing135✓ EXPLORED
Mixture of Experts Routing
- Sparse Transformer with Local Attention136✓ EXPLORED
Sparse Transformer with Local Attention
- Low-Rank Adaptation (LoRA)137✓ EXPLORED
Low-Rank Adaptation (LoRA)
- Gradient Checkpointing for Memory-Efficient Training138✓ EXPLORED
Gradient Checkpointing for Memory-Efficient Training
- Model Soups: Weight Averaging for Improved Robustness139✓ EXPLORED
Model Soups: Weight Averaging for Improved Robustness
- Manifold Mixup for Better Representations140✓ EXPLORED
Manifold Mixup for Better Representations
- Speculative Decoding for Faster LLM Inference141✓ EXPLORED
Speculative Decoding for Faster LLM Inference
- Multimodal Chain-of-Thought Reasoning142✓ EXPLORED
Multimodal Chain-of-Thought Reasoning
- Preference Optimization via Nash Learning143✓ EXPLORED
Preference Optimization via Nash Learning
- Red Teaming with Language Models144✓ EXPLORED
Red Teaming with Language Models
- Mechanistic Interpretability of Induction Heads145✓ EXPLORED
Mechanistic Interpretability of Induction Heads
- Extreme Low-Bit Post-Training Quantization146✓ EXPLORED
Extreme Low-Bit Post-Training Quantization
- Data Selection via Perplexity for Language Model Training147✓ EXPLORED
Data Selection via Perplexity for Language Model Training
- The Deep Learning Hardware Revolution148✓ EXPLORED
The Deep Learning Hardware Revolution
- Vector-Quantized Variational Autoencoders (VQ-VAE)149✓ EXPLORED
Vector-Quantized Variational Autoencoders (VQ-VAE)
- Gradient-Based Meta-Learning (MAML)150✓ EXPLORED
Gradient-Based Meta-Learning (MAML)
- Sharpness-Aware Minimization (SAM)151✓ EXPLORED
Sharpness-Aware Minimization (SAM)
- Paged Attention for Efficient Memory Management152✓ EXPLORED
Paged Attention for Efficient Memory Management
- Unified Embedding Space for All Modalities153✓ EXPLORED
Unified Embedding Space for All Modalities
- Multi-Agent Deep Reinforcement Learning with Centralized Critics154✓ EXPLORED
Multi-Agent Deep Reinforcement Learning with Centralized Critics
- Scalable Oversight via Recursive Reward Modeling155✓ EXPLORED
Scalable Oversight via Recursive Reward Modeling
- Benchmarking Hallucination in Language Models156✓ EXPLORED
Benchmarking Hallucination in Language Models
- Activation Compression via Quantized Training157✓ EXPLORED
Activation Compression via Quantized Training
- Deduplication of Massive Training Datasets158✓ EXPLORED
Deduplication of Massive Training Datasets
- The Transformer Architecture Paper159✓ EXPLORED
The Transformer Architecture Paper
- Recurrent Independent Mechanisms160✓ EXPLORED
Recurrent Independent Mechanisms
- Self-Supervised Learning of Visual Features via Contrastive Loss161✓ EXPLORED
Self-Supervised Learning of Visual Features via Contrastive Loss
- AdaFactor: Adaptive Learning Rates with Sublinear Memory162✓ EXPLORED
AdaFactor: Adaptive Learning Rates with Sublinear Memory
- Continuous Batching in LLM Serving163✓ EXPLORED
Continuous Batching in LLM Serving
- Compositional Visual Reasoning with Neural Module Networks164✓ EXPLORED
Compositional Visual Reasoning with Neural Module Networks
- Reward Model Overoptimization165✓ EXPLORED
Reward Model Overoptimization
- TruthfulQA: Benchmarking Tendency to Generate Falsehoods166✓ EXPLORED
TruthfulQA: Benchmarking Tendency to Generate Falsehoods
- Causal Abstraction for Model Verification167✓ EXPLORED
Causal Abstraction for Model Verification
- Sliding Window Attention for Infinite Context168✓ EXPLORED
Sliding Window Attention for Infinite Context
- Model Contamination Detection in Benchmarks169✓ EXPLORED
Model Contamination Detection in Benchmarks
- The Bitter Lesson of Compute and Scale170✓ EXPLORED
The Bitter Lesson of Compute and Scale
- Vision Transformer (ViT) Scaling171✓ EXPLORED
Vision Transformer (ViT) Scaling
- Gradient Surgery for Multi-Task Learning172✓ EXPLORED
Gradient Surgery for Multi-Task Learning
- Sparse Mixture of Experts Inference Routing173✓ EXPLORED
Sparse Mixture of Experts Inference Routing
- Neural Tangent Kernel Theory for Wide Networks174✓ EXPLORED
Neural Tangent Kernel Theory for Wide Networks
- Transformer Memory Compression via Sliding Windows175✓ EXPLORED
Transformer Memory Compression via Sliding Windows
- Neural Radiance Fields for 3D Reconstruction176✓ EXPLORED
Neural Radiance Fields for 3D Reconstruction
- Soft Actor-Critic with Maximum Entropy177✓ EXPLORED
Soft Actor-Critic with Maximum Entropy
- Red Teaming for Language Model Safety178✓ EXPLORED
Red Teaming for Language Model Safety
- Benchmarking Compositional Generalization179✓ EXPLORED
Benchmarking Compositional Generalization
- Mechanistic Interpretability of Grokking180✓ EXPLORED
Mechanistic Interpretability of Grokking
- Speculative Decoding for Faster Inference181✓ EXPLORED
Speculative Decoding for Faster Inference
- Text-to-3D Generation with Score Distillation182✓ EXPLORED
Text-to-3D Generation with Score Distillation
- Human Feedback from Comparisons183✓ EXPLORED
Human Feedback from Comparisons
- Mixture Density Networks for Uncertainty184✓ EXPLORED
Mixture Density Networks for Uncertainty
- Coresets for Efficient Dataset Summarization185✓ EXPLORED
Coresets for Efficient Dataset Summarization
- Knowledge Distillation from Multiple Teachers186✓ EXPLORED
Knowledge Distillation from Multiple Teachers
- Weight Agnostic Neural Architecture Search187✓ EXPLORED
Weight Agnostic Neural Architecture Search
- Deep Double Descent: Beyond U-Shaped Risk188✓ EXPLORED
Deep Double Descent: Beyond U-Shaped Risk
- Volumetric Rendering with Neural Graphics Primitives189✓ EXPLORED
Volumetric Rendering with Neural Graphics Primitives
- Multi-Task Learning with Task Balancing190✓ EXPLORED
Multi-Task Learning with Task Balancing
- Efficient ViT with Shifted Windows191✓ EXPLORED
Efficient ViT with Shifted Windows
- No-Regret Online Learning to Nash Equilibrium192✓ EXPLORED
No-Regret Online Learning to Nash Equilibrium
- Model Parallelism with Pipeline Bubbles193✓ EXPLORED
Model Parallelism with Pipeline Bubbles
- Video Diffusion with Temporal Consistency194✓ EXPLORED
Video Diffusion with Temporal Consistency
- Recursive Reward Modeling for Scalable Oversight195✓ EXPLORED
Recursive Reward Modeling for Scalable Oversight
- Out-of-Distribution Detection via Likelihood Ratios196✓ EXPLORED
Out-of-Distribution Detection via Likelihood Ratios
- Causal Abstraction via Interchange Interventions197✓ EXPLORED
Causal Abstraction via Interchange Interventions
- Quantization with Learned Rounding198✓ EXPLORED
Quantization with Learned Rounding
- Data Valuation with Shapley Values199✓ EXPLORED
Data Valuation with Shapley Values
- Transformer Positional Encoding Alternatives200✓ EXPLORED
Transformer Positional Encoding Alternatives
- Memory-Efficient Backpropagation with Reversible Layers201✓ EXPLORED
Memory-Efficient Backpropagation with Reversible Layers
- Audio-Driven Talking Head Generation202✓ EXPLORED
Audio-Driven Talking Head Generation
- Constitutional AI for Harmless Assistance203✓ EXPLORED
Constitutional AI for Harmless Assistance
- Adversarial Evaluation of Multimodal Reasoning204✓ EXPLORED
Adversarial Evaluation of Multimodal Reasoning
- Sparse Autoencoders for Dictionary Learning205✓ EXPLORED
Sparse Autoencoders for Dictionary Learning
- Dynamic Quantization During Serving206✓ EXPLORED
Dynamic Quantization During Serving
- Synthetic Data Generation with Differential Privacy207✓ EXPLORED
Synthetic Data Generation with Differential Privacy
- History: The 2012 AlexNet Revolution208✓ EXPLORED
History: The 2012 AlexNet Revolution
- Graph Transformers with Structural Encodings209✓ EXPLORED
Graph Transformers with Structural Encodings
- Optimization Theory for Adaptive Gradient Methods210✓ EXPLORED
Optimization Theory for Adaptive Gradient Methods
- Multi-Task Reinforcement Learning with Shared Representations211✓ EXPLORED
Multi-Task Reinforcement Learning with Shared Representations
- Differentiable Architecture Search212✓ EXPLORED
Differentiable Architecture Search
- Mixture of Experts: Sparse Routing at Scale213✓ EXPLORED
Mixture of Experts: Sparse Routing at Scale
- Retentive Networks for Long Sequences214✓ EXPLORED
Retentive Networks for Long Sequences
- State Space Models for Long Sequences215✓ EXPLORED
State Space Models for Long Sequences
- Differential Privacy by Noising Gradients216✓ EXPLORED
Differential Privacy by Noising Gradients
- Progressive Growing of GANs217✓ EXPLORED
Progressive Growing of GANs
- Meta-Learning with External Memory218✓ EXPLORED
Meta-Learning with External Memory
- Loss Landscapes: Flat Minima and Sharp Ones219✓ EXPLORED
Loss Landscapes: Flat Minima and Sharp Ones
- The Information Bottleneck220✓ EXPLORED
The Information Bottleneck
- The Lottery Ticket Hypothesis221✓ EXPLORED
The Lottery Ticket Hypothesis
- The Neural Tangent Kernel222✓ EXPLORED
The Neural Tangent Kernel
- Feature Learning: The Lazy-to-Rich Transition223✓ EXPLORED
Feature Learning: The Lazy-to-Rich Transition
- Emergence: Abilities That Appear Only With Scale224✓ EXPLORED
Emergence: Abilities That Appear Only With Scale
- KV Cache Compression for Long Context225✓ EXPLORED
KV Cache Compression for Long Context
- Predictive Auto-Scaling for Model Serving226✓ EXPLORED
Predictive Auto-Scaling for Model Serving
- Elastic Training: Surviving a Lost Machine227✓ EXPLORED
Elastic Training: Surviving a Lost Machine
- near‑data‑processing-for-embedding-lookup228✓ EXPLORED
near‑data‑processing-for-embedding-lookup
- Contrastive Learning Across Vision, Audio and Text229✓ EXPLORED
Contrastive Learning Across Vision, Audio and Text
- Vision-Language-Action Models for Robotics230✓ EXPLORED
Vision-Language-Action Models for Robotics
- World Models: Planning Inside a Learned Simulator231✓ EXPLORED
World Models: Planning Inside a Learned Simulator
- Imitation Learning from Observation232✓ EXPLORED
Imitation Learning from Observation
- Model-Based RL and the Limits of a Learned Simulator233✓ EXPLORED
Model-Based RL and the Limits of a Learned Simulator
- Inverse Reinforcement Learning234✓ EXPLORED
Inverse Reinforcement Learning
- Trojans and Backdoors: Models with Hidden Triggers235✓ EXPLORED
Trojans and Backdoors: Models with Hidden Triggers
- evaluation-with-adversarial-n‑way-forcing236✓ EXPLORED
evaluation-with-adversarial-n‑way-forcing
- Calibration: When Confidence Matches Correctness237✓ EXPLORED
Calibration: When Confidence Matches Correctness
- Probing for Linguistic Knowledge238✓ EXPLORED
Probing for Linguistic Knowledge
- Ablation: Reading Function by Removing Parts239✓ EXPLORED
Ablation: Reading Function by Removing Parts
- LoRA: Low-Rank Fine-Tuning240✓ EXPLORED
LoRA: Low-Rank Fine-Tuning
- Synthetic Data for Data-Scarce Domains241✓ EXPLORED
Synthetic Data for Data-Scarce Domains
- Active Learning: Choosing What to Label242✓ EXPLORED
Active Learning: Choosing What to Label
- Cleaning Web-Scale Training Data243✓ EXPLORED
Cleaning Web-Scale Training Data
- Connectionism versus Symbolism244✓ EXPLORED
Connectionism versus Symbolism
- The Rise of Self-Supervised Learning245✓ EXPLORED
The Rise of Self-Supervised Learning
- Vision-Transformer Hybrid Architectures246✓ EXPLORED
Vision-Transformer Hybrid Architectures
- MoE Routing Strategies247✓ EXPLORED
MoE Routing Strategies
- Model Merging via Weight Interpolation248✓ EXPLORED
Model Merging via Weight Interpolation
- Mechanistic Interpretability of In-Context Learning249✓ EXPLORED
Mechanistic Interpretability of In-Context Learning
- Retentive Networks (RetNet)250✓ EXPLORED
Retentive Networks (RetNet)
- JEPA and I-JEPA251✓ EXPLORED
JEPA and I-JEPA
- Preference Optimization with DPO252✓ EXPLORED
Preference Optimization with DPO
- Temporal Difference Learning Theory253✓ EXPLORED
Temporal Difference Learning Theory
- Memorization vs. Generalization in Large Models254UNOPENED
Memorization vs. Generalization in Large Models
- 255
Arrives day 255
Not yet unlocked
- 256
Arrives day 256
Not yet unlocked
- 257
Arrives day 257
Not yet unlocked
- 258
Arrives day 258
Not yet unlocked
- 259
Arrives day 259
Not yet unlocked
- 260
Arrives day 260
Not yet unlocked
- 261
Arrives day 261
Not yet unlocked
- 262
Arrives day 262
Not yet unlocked
- 263
Arrives day 263
Not yet unlocked
- 264
Arrives day 264
Not yet unlocked
- 265
Arrives day 265
Not yet unlocked
- 266
Arrives day 266
Not yet unlocked
- 267
Arrives day 267
Not yet unlocked
- 268
Arrives day 268
Not yet unlocked
- 269
Arrives day 269
Not yet unlocked
- 270
Arrives day 270
Not yet unlocked
- 271
Arrives day 271
Not yet unlocked
- 272
Arrives day 272
Not yet unlocked
- 273
Arrives day 273
Not yet unlocked
- 274
Arrives day 274
Not yet unlocked
- 275
Arrives day 275
Not yet unlocked
- 276
Arrives day 276
Not yet unlocked
- 277
Arrives day 277
Not yet unlocked
- 278
Arrives day 278
Not yet unlocked
- 279
Arrives day 279
Not yet unlocked
- 280
Arrives day 280
Not yet unlocked
- 281
Arrives day 281
Not yet unlocked
- 282
Arrives day 282
Not yet unlocked
- 283
Arrives day 283
Not yet unlocked
- 284
Arrives day 284
Not yet unlocked
- 285
Arrives day 285
Not yet unlocked
- 286
Arrives day 286
Not yet unlocked
- 287
Arrives day 287
Not yet unlocked
- 288
Arrives day 288
Not yet unlocked
- 289
Arrives day 289
Not yet unlocked
- 290
Arrives day 290
Not yet unlocked
- 291
Arrives day 291
Not yet unlocked
- 292
Arrives day 292
Not yet unlocked
- 293
Arrives day 293
Not yet unlocked
- 294
Arrives day 294
Not yet unlocked
- 295
Arrives day 295
Not yet unlocked
- 296
Arrives day 296
Not yet unlocked
- 297
Arrives day 297
Not yet unlocked
- 298
Arrives day 298
Not yet unlocked
- 299
Arrives day 299
Not yet unlocked
- 300
Arrives day 300
Not yet unlocked
- 301
Arrives day 301
Not yet unlocked
- 302
Arrives day 302
Not yet unlocked
- 303
Arrives day 303
Not yet unlocked
- 304
Arrives day 304
Not yet unlocked
- 305
Arrives day 305
Not yet unlocked
- 306
Arrives day 306
Not yet unlocked
- 307
Arrives day 307
Not yet unlocked
- 308
Arrives day 308
Not yet unlocked
- 309
Arrives day 309
Not yet unlocked
- 310
Arrives day 310
Not yet unlocked
- 311
Arrives day 311
Not yet unlocked
- 312
Arrives day 312
Not yet unlocked
- 313
Arrives day 313
Not yet unlocked
- 314
Arrives day 314
Not yet unlocked
- 315
Arrives day 315
Not yet unlocked
- 316
Arrives day 316
Not yet unlocked
- 317
Arrives day 317
Not yet unlocked
- 318
Arrives day 318
Not yet unlocked
- 319
Arrives day 319
Not yet unlocked
- 320
Arrives day 320
Not yet unlocked
- 321
Arrives day 321
Not yet unlocked
- 322
Arrives day 322
Not yet unlocked
- 323
Arrives day 323
Not yet unlocked
- 324
Arrives day 324
Not yet unlocked
- 325
Arrives day 325
Not yet unlocked
- 326
Arrives day 326
Not yet unlocked
- 327
Arrives day 327
Not yet unlocked
- 328
Arrives day 328
Not yet unlocked
- 329
Arrives day 329
Not yet unlocked
- 330
Arrives day 330
Not yet unlocked
- 331
Arrives day 331
Not yet unlocked
- 332
Arrives day 332
Not yet unlocked
- 333
Arrives day 333
Not yet unlocked
- 334
Arrives day 334
Not yet unlocked
- 335
Arrives day 335
Not yet unlocked
- 336
Arrives day 336
Not yet unlocked
- 337
Arrives day 337
Not yet unlocked
- 338
Arrives day 338
Not yet unlocked
- 339
Arrives day 339
Not yet unlocked
- 340
Arrives day 340
Not yet unlocked
- 341
Arrives day 341
Not yet unlocked
- 342
Arrives day 342
Not yet unlocked
- 343
Arrives day 343
Not yet unlocked
- 344
Arrives day 344
Not yet unlocked
- 345
Arrives day 345
Not yet unlocked
- 346
Arrives day 346
Not yet unlocked
- 347
Arrives day 347
Not yet unlocked
- 348
Arrives day 348
Not yet unlocked
- 349
Arrives day 349
Not yet unlocked
- 350
Arrives day 350
Not yet unlocked
- 351
Arrives day 351
Not yet unlocked
- 352
Arrives day 352
Not yet unlocked
- 353
Arrives day 353
Not yet unlocked
- 354
Arrives day 354
Not yet unlocked
- 355
Arrives day 355
Not yet unlocked
- 356
Arrives day 356
Not yet unlocked
- 357
Arrives day 357
Not yet unlocked
- 358
Arrives day 358
Not yet unlocked
- 359
Arrives day 359
Not yet unlocked
- 360
Arrives day 360
Not yet unlocked
- 361
Arrives day 361
Not yet unlocked
- 362
Arrives day 362
Not yet unlocked
- 363
Arrives day 363
Not yet unlocked
- 364
Arrives day 364
Not yet unlocked
- 365
Arrives day 365
Not yet unlocked