← 回主題列表 TOPIC · LOCAL LLM

🖥️ 個人地端大語言模型實作

想在自己的電腦或自家 GPU 上跑開源大模型?八堂課把整條路走一遍: 先選對推理引擎,看懂 KV Cache 這條貫穿選型、計費、加速的主線, 再學會把服務看好、把模型調成你的。全部在瀏覽器裡互動模擬,不用先買顯卡。

ENGINE · 01

⚖️ 引擎選型:Ollama vs vLLM

同一台機器、兩種脾氣——拉一下請求長度分佈,親眼看見 9% 對 98% 的記憶體利用率, 順便拆穿「快 34 倍」那種標題數字。

開始上課 →
SAMPLING · 02

🎲 取樣參數:模型怎麼挑下一個字

temperature、top_p、penalty 看起來各管各的,其實全部在調同一顆不公平的骰子—— 拉一下拉桿、擲二十次骰子,你就懂了。

開始上課 →
KV CACHE · 03

🗂️ 看懂 KV Cache

快取=存會被重複讀的東西。看懂注意力怎麼算,就知道為什麼只存 K、V 不存 Q, 也知道為什麼開頭多一行時間戳,後面幾千字的前綴就全部作廢。

開始上課 →
BILLING · 04

💰 Prompt Caching:連續對話的錢怎麼算

對話歷史只增不改,所以那段越來越長的歷史幾乎不要錢——三輪省 32%、二十輪省 68%; 真正燒錢的是你在中途換了模型,算給你看。

開始上課 →
OFFLOAD · 05

💾 KV Cache 分層:LMCache 與 SSD 卸載

KV cache 放不下就往 SSD 丟,划算嗎?實測最高快 2.3 倍—— 但算完你可能會鬆一口氣:省下的是一筆採購。

開始上課 →
SPEC DECODE · 06

🏇 投機解碼:先猜後驗

反正權重都要搬一次,順便多驗五個字幾乎免費——用閒置算力換體感速度, 數學保證輸出一字不差。拉接受率拉桿,找出什麼時候反而會虧。

開始上課 →
OBSERVE · 07

🔭 可觀測性與監控:看見你的 LLM

同一句「LLM 變慢了」,Grafana 告訴你為什麼慢、trace 告訴你慢在哪一步—— 轉一下告警旋鈕,親眼看誤報怎麼消失、代價是什麼。

開始上課 →
FINETUNE · 08

📝 微調入門:LoRA 與 SFT、DPO

凍結整本教科書,只貼一張幾 MB 的便利貼——參數量縮小 128 倍,效果幾乎一樣好。 α/r 控制力道、SFT 學模仿、DPO 學分辨好壞。

開始上課 →