Schedule

Class calendar

To see the full list of papers and their details, please refer to the Reading List tab.

Explanations of the presenter, advocate, and critic group roles are available in the Resources tab.

This schedule is subject to change and currently serves as a placeholder while we finalize discussion-group assignments and a few remaining class activities.

Date Classroom Agenda Slide deck Presenter Group Advocate Group Critic Group
August 25
Instructor lecture - course overview
Slide deck
August 27
Instructor lecture - hardware for AI
Slide deck
September 1
Instructor lecture - language model basics
September 3
Paper discussion
Efficient Memory Management for Large Language Model Serving with PagedAttention
zhong45, jinruih2, sehyeon2TBDTBD
September 8
Paper discussion
Taming Throughput-Latency Tradeoff in LLM Inference with Sarathi-Serve
TBDTBDTBD
September 10
Paper discussion
Splitwise: Efficient Generative LLM Inference Using Disaggregated Compute
nsatch3, bikrant2, pilarl2, dsun19TBDTBD
September 15
Paper discussion
Fast Inference from Large Language Models via Speculative Decoding
TBDTBDTBD
September 17
Paper discussion
Triton: An Intermediate Language and Compiler for Tiled Neural Network Computations
TBDTBDTBD
September 22
No class
September 24
Paper discussion
Mirage Persistent Kernel: A Compiler and Runtime for Mega-Kernelizing Tensor Programs
TBDTBDTBD
September 29
Paper discussion
FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness
TBDTBDTBD
October 1
Google Guest Lecture
Suvinay Subramanian
October 6
Intel Guest Lecture
Mrittika Ganguli
October 8
Paper discussion
Parrot: Efficient Serving of LLM-Based Applications with Semantic Variable
TBDTBDTBD
October 13
Paper discussion
Insights into DeepSeek-V3: Scaling Challenges and Reflections on Hardware for AI Architectures
TBDTBDTBD
October 15
NVIDIA Guest Lecture
Vikram Sharma Mailthody
October 20
Midterm Project Review
October 22
Midterm Project Review
October 27
Gimlet Labs Guest Lecture
Ankita Nayak
October 29
Paper discussion
Patterns Behind Chaos: Forecasting Data Movement for Efficient Large-Scale MoE LLM Inference
TBDTBDTBD
November 3
Paper discussion
Timeloop: A Systematic Approach to DNN Accelerator Evaluation
TBDTBDTBD
November 5
NVIDIA Guest Lecture
Benjamin Klenk
November 10
Paper discussion
SMEPilot: Characterizing and Optimizing LLM Inference with Scalable Matrix Extensions
TBDTBDTBD
November 12
Paper discussion
Corsair: An In-Memory Computing Chiplet Architecture for Inference-Time Compute Acceleration
TBDTBDTBD
November 17
Paper discussion
Agent.xpu: Efficient Scheduling of Agentic LLM Workloads on Heterogeneous SoC
TBDTBDTBD
November 19
Cerebras Guest Lecture
Ishita Chaturvedi
November 24
Fall break
November 26
Fall break
December 1
Paper discussion
DynamoLLM: Designing LLM Inference Clusters for Performance and Energy Efficiency
TBDTBDTBD
December 3
December 8
Final project demonstration