計算機科學與技術專業大三《強化學習》復習課教學設計_第1頁
計算機科學與技術專業大三《強化學習》復習課教學設計_第2頁
計算機科學與技術專業大三《強化學習》復習課教學設計_第3頁
計算機科學與技術專業大三《強化學習》復習課教學設計_第4頁
計算機科學與技術專業大三《強化學習》復習課教學設計_第5頁
已閱讀5頁,還剩7頁未讀 繼續免費閱讀

付費下載

下載本文檔

版權說明:本文檔由用戶提供并上傳,收益歸屬內容提供方,若內容存在侵權,請進行舉報或認領

文檔簡介

計算機科學與技術專業大三《強化學習》復習課教學設計

一、課程定位與復習目標體系

(一)學科與學段定位

本設計面向大學三年級計算機科學與技術專業本科生,對應課程為人工智能方向核心必修課《強化學習》。學生已系統學習概率論、線性代數、Python編程及機器學習基礎,正處于從經典監督學習范式向序貫決策范式跨越的關鍵階段。復習課定位于認知重構與能力遷移,旨在幫助學生在期末備考與項目實踐中完成從碎片化知識點到結構化認知網絡的躍遷。

(二)總復習目標

依據布魯姆認知目標新分類與工程教育認證產出導向理念,確立三層級目標。知識維度:精準復述馬爾可夫決策過程的五元組構成、貝爾曼方程的數學本質、主流無模型算法的更新規則,達成零盲區覆蓋。能力維度:在給定網格世界、黑杰克或連續控制環境中,獨立完成從MDP形式化建模到算法選型、代碼調試與性能調優的全流程推演。素養維度:建立探索與利用悖論的工程哲學觀,能夠辯證分析樣本效率與漸進最優性之間的權衡,形成對深度強化學習穩定性問題的批判性思維。

(三)課時與課型

共計4學時,每學時50分鐘,分兩次課實施。第一次課聚焦表格型方法及其數學內核,第二次課攻克深度強化學習與策略梯度家族。課型為專題整合式復習,采用大概念統攝、問題鏈驅動、真題變式嵌入的高密度講練結合模式。

二、復習內容全景圖譜與重要度標記

(一)強化學習問題形式化模塊

馬爾可夫決策過程五元組核心要素。【基礎】狀態空間、動作空間、狀態轉移概率、即時獎勵、折扣因子。部分可觀測馬爾可夫決策過程與完全可觀測的辨析邊界。【重要】回報與折扣累積回報的計算通式。軌跡、回合與連續任務的區別。【基礎】強化學習與監督學習、無監督學習的根本分野:延遲獎勵與主動探索。環境的模型已知與未知對算法分類的根本性影響。【非常重要】

(二)最優準則與貝爾曼理論模塊

策略、確定性策略與隨機性策略的數學表示。【基礎】狀態值函數與動作值函數的定義、二者互換關系、貝爾曼期望方程與貝爾曼最優方程的推導與不動點含義。【非常重要】【高頻考點】最優值函數與最優策略的等價性定理。策略改進定理與策略提升的單調性保證。【重要】動態規劃視角下的全寬備份與異步備份思想。

(三)經典表格算法模塊

動態規劃在模型已知時的應用:策略迭代的雙層循環結構、值迭代的收縮映射視角。【重要】蒙特卡洛方法的回合更新機制、首次訪問與每次訪問的異同、增量式計算均值技巧。【基礎】時序差分學習的核心理念:利用未來估計修正當前估計。SARSA算法的同軌特性與Q學習算法的離軌革命。【非常重要】【高頻考點】期望SARSA與DoubleQ學習對偏差方差的改良。【熱點】探索策略:ε-貪婪、上置信界、湯普森采樣的思想脈絡。【難點】

(四)值函數近似與深度強化學習模塊

函數逼近的引入原因:大規模狀態空間的維度災難。【重要】深度Q網絡的三大支柱:經驗回放打破數據相關性、目標網絡穩定訓練目標、卷積神經網絡自動提取視覺特征。【非常重要】【高頻考點】DQN的變體演進:DoubleDQN對過估計的抑制、DuelingDQN對優勢函數與價值函數的分流建模、優先級經驗回放對樣本效率的提升。【熱點】深度強化學習的頑疾:過估計、樣本效率低下、訓練不穩定、獎勵稀疏。【難點】

(五)策略優化與基于模型強化學習模塊

策略梯度定理的數學形式與REINFORCE算法的蒙特卡洛實現。【非常重要】Actor-Critic架構的必然性:降低方差同時引入偏差。優勢函數估計:廣義優勢估計。【重要】自然策略梯度、信任區域策略優化與近端策略優化裁剪目標的動機。【熱點】【難點】基于模型的強化學習的雙刃劍:學習環境模型帶來的樣本效率收益與復合誤差放大風險。集成學習在模型不確定性問題上的應用。【基礎】

三、教學實施過程的深度展開

(一)第一學時:破冰重構與MDP建模復盤

1.認知沖突導入階段

教師展示三段短視頻:AlphaGo自我對弈落子、自動駕駛車輛在模擬器中完成無保護左轉、機械臂通過試錯學會抓取不同形狀積木。提出問題:這三個問題表面差異巨大,但能否用同一套數學語言描述其決策共性?要求學生以學習小組為單位,在3分鐘內提煉出至少三個共性要素。學生必然提出目標、動作、反饋、環境等關鍵詞。教師順勢點明:這正是序貫決策中馬爾可夫決策過程所抽象的四類實體。此時不直接給出定義,而是以板書形式將學生答案映射至MDP五元組符號,完成從具象經驗到形式符號的第一次抽象躍遷。【非常重要】

2.核心概念網狀互鎖

教師以網格世界為貫穿性載體,呈現一個4×4網格,左上角為起點,右下角為終點,中間設有懲罰性禁區。要求學生現場為這一網格世界完整填寫五元組內容。狀態空間為16個格子;動作空間為上下左右;轉移概率在確定性環境中為1.0;獎勵函數設計為到達終點+1,踏入禁區-1,其余步長-0.01以鼓勵最短路徑;折扣因子設為0.99。此環節采用學生口述、教師板書的交互方式,刻意暴露學生在轉移概率與獎勵函數區分上的認知模糊。教師以班杜拉社會學習理論為支撐,邀請一位正確建模的學生講解其思考路徑,實現同伴示范。【基礎】

3.值函數概念的多元表征融合

教師出示兩種值函數可視化形式:第一種是網格世界熱力圖,每個格子標注數值,代表該狀態的價值;第二種是狀態動作對的三維柱狀圖。要求學生用自然語言描述熱力圖中高亮區域為什么價值更高,并反推出可能的最優路徑。隨后教師提出貝爾曼方程,不直接寫出公式,而是以遞推關系式呈現:當前狀態價值等于即時獎勵加上未來狀態價值的折扣平均。學生分組在網格世界中驗證貝爾曼期望方程是否成立。教師提供部分計算數據,學生進行數值驗算,最終由學生代表歸納出方程結構。【重要】此環節關鍵點在于讓學生意識到貝爾曼方程是自洽性條件,而非求解方法,為后續動態規劃埋下伏筆。

4.即時診斷與反饋

教師呈現五個短選擇題,覆蓋狀態轉移概率計算、折扣因子對遠期獎勵影響、確定性策略與隨機性策略圖示辨析等。采用答題器或手勢投票實時獲取正確率。對于正確率低于60%的題目,立即進行變式再練,不進入下一進度。【高頻考點】

(二)第二學時:動態規劃與蒙特卡洛的方法論對比

5.思維可視化策略迭代

教師不在屏幕上直接展示偽代碼,而是讓學生扮演策略評估與策略改進兩個角色。教室左側為評估組,右側為改進組。給定一個初始隨機策略,評估組通過貝爾曼方程迭代計算當前策略下的值函數;改進組根據新的值函數貪婪地更新策略。兩輪迭代后,學生直觀感受到策略如何在交互中單調提升至最優。教師此時才形式化寫出策略迭代的收斂性定理,并指出其本質是使用貝爾曼期望方程作為計算內核。【重要】隨后拋出關鍵問題:如果狀態空間爆炸,無法進行全寬備份,人類如何進行高效學習?引導學生關注試錯經驗的價值。

6.蒙特卡洛方法的經驗主義轉向

教師播放蒙特卡洛樹搜索在圍棋對局中的落子選擇動畫。類比人類通過多次完整對局積累勝負經驗。教師設計一個迷你二十一點簡化版游戲,現場生成少量回合數據。要求學生僅基于這些回合數據,計算某狀態或狀態動作對的平均回報值。學生自然采用增量平均公式。教師此時點明這就是蒙特卡洛方法的核心。進一步追問:首次訪問與每次訪問在有限樣本下會得出不同估計,哪個偏差更低?學生通過計算具體數值發現,首次訪問是無偏估計,每次訪問在有因狀態重復進入時引入偏差但方差更小。此辨析為【難點】且是近年考研高頻命題點。【高頻考點】

7.時序差分學習的認知革命

教師設計認知沖突:蒙特卡洛方法必須等到回合結束才能學習,這對沒有終止的持續任務是致命缺陷。如何在不完整軌跡上更新?教師用倒車入庫作類比:不必等到完全停穩才判斷是否成功,在倒車過程中偏離中線就應實時修正。由此引出時序差分學習用后續估計替代真實回報的思想。教師展示SARSA算法更新公式,強調五元組名稱來源,并讓學生在網格世界中執行一步人工更新。【非常重要】緊接著對比Q學習,通過懸崖行走問題情境,展示Q學習直接選取最大下一動作值,可能導致路徑貼近懸崖邊;SARSA因考慮實際選擇動作,路徑更保守安全。這一對比揭示了離軌策略與同軌策略的根本差異,是期末試卷大題的經典素材。【高頻考點】

8.算法家族樹構建

教師引導學生共同繪制表格型強化學習算法分類樹:根節點分為基于模型與無模型;無模型下分基于回合與基于步進;基于步進下分同軌與離軌。每個算法旁標注更新公式的異同。學生繪制過程中自然完成知識結構化,教師抽查并糾正常見錯誤,如將Q學習歸入同軌策略。【非常重要】

(三)第三學時:深度強化學習的工程智慧

9.從表格到泛化的必然躍遷

教師呈現圍棋棋盤、Atari游戲原始像素輸入,提問:若將每個像素排列組合視為狀態,狀態空間數量級是多少?學生估算后驚嘆宇宙原子總數也難以比擬。教師點明神經網絡的歸納偏置正是解決維度災難的鑰匙。但神經網絡在強化學習中的首次嘗試為何一度失敗?教師復現經典實驗:線性網絡在懸崖行走中甚至無法收斂。引導學生分析原因:相鄰樣本高度相關、非平穩目標不斷移動。學生分組討論,每組提出一種可能的補救思路,教師將學生方案寫在副板書上,與DQN三項突破逐一比對,學生對深度強化學習設計者的洞察力產生高度敬意。【非常重要】

10.DQN三模塊拆解與變體演進

教師以CartPole平衡桿為仿真環境,現場運行DQN訓練代碼,可視化損失曲線與平均獎勵曲線。在訓練中斷點展示經驗池中存儲的轉移樣本,讓學生直觀感受打破相關性的必要性。接著展示目標網絡更新前后值函數預測的變化,理解固定目標對穩定性的關鍵作用。【重要】隨后呈現DoubleDQN與DuelingDQN的結構圖。教師不直接講解論文結論,而是讓學生根據過估計現象自主推導改進方向。在教師引導下,學生發現若用兩個網絡解耦選擇和評估,即可抑制過估計。進而將Dueling結構拆分為優勢流與價值流,學生通過反向傳播圖理解為何這種分叉能學到狀態價值而不必學習每個動作的絕對價值。【熱點】【難點】

11.連續動作空間的策略直譯

教師提出困境:DQN輸出層是softmax對應離散動作概率,若動作是方向盤轉角連續值怎么辦?學生陷入沉思。教師引出策略梯度家族,強調其根本思想是參數化策略而非值函數。以REINFORCE算法為例,現場推導策略梯度定理:目標函數梯度等于軌跡總回報乘以策略對數概率梯度。教師手推核心推導步驟,強調此處的期望是通過采樣估計的。【非常重要】學生通過計算圖理解為什么高回報軌跡被強化、低回報軌跡被抑制。隨后引入Actor-Critic,解釋用值函數作為基線降低方差的思想。學生此時能認識到:這實質上是融合了基于值函數與基于策略兩類方法的優勢。

12.PPO的工程美學

教師呈現TRPO的復雜約束優化形式,再展示PPO的裁剪替代目標,并提問:為何業界普遍棄TRPO而從PPO?學生閱讀教師提供的簡短偽代碼,發現PPO僅需幾行修改即可在現有策略梯度代碼中實現,且超參數魯棒。教師組織微型辯論:一方支持理論嚴謹性,一方擁護工程簡潔性。辯論中學生深化了對強化學習研究范式的理解:在樣本效率與實現復雜度之間尋求帕累托前沿。此環節將學術史與工程思維融為一體,屬于高階素養目標。【熱點】

(四)第四學時:綜合實戰與應試沖刺

13.真題剖解與變式鏈訓練

教師從近五年全國頂尖高校強化學習考題及CCFCSP認證強化學習專項中抽取三道代表性試題,按難度階梯排列。第一題為MDP建模與值迭代計算,要求學生手工迭代至收斂。教師展示評分標準,強調步驟分的關鍵得分點。第二題為Q學習更新過程推導,給定初始Q表與一條交互序列,要求學生寫出每一步更新后的Q值,并分析探索策略參數對收斂的影響。學生獨立完成后組內互評,教師展示常見錯誤:將學習率遺忘、對下一狀態最大動作值誤判等。【高頻考點】第三題為策略梯度證明題,給出簡化環境,要求學生推導梯度表達式并解釋為何加入基線不影響梯度期望。教師將證明過程拆分為三段填空式,逐步搭建腳手架,最終由學生獨立完成完整證明。【難點】

14.綜合項目微仿寫

教師發布一個未曾謀面的新環境:貨物調度MDP,狀態為各倉庫庫存,動作為調撥數量,獎勵為滿足訂單收益減運輸成本。要求學生在40分鐘內完成四項子任務:形式化MDP五元組、選擇合適算法并闡述理由、寫出核心更新偽代碼、預測算法在稀疏獎勵下的可能失敗模式并給出改進方向。學生以個人為單位進行限時設計,教師巡回指導。此環節高度模擬開卷考試中設計題場景,同時鍛煉工程落地前的推演能力。【非常重要】

15.知識盲區洗牌與互測

實施同伴教學法:每名學生將自己在復習過程中始終困惑的一個問題寫在卡片上,小組內洗牌后隨機抽取,當場作答。教師收集共性困惑,如策略梯度的對數技巧為何能轉化概率梯度、目標網絡更新頻率的調參經驗等,進行全班集中答疑。此環節不僅掃清盲點,更培養學生提出問題、界定問題的元認知能力。【基礎】

四、復習策略指導與資源支架

(一)分層備考建議

針對基礎薄弱學生,要求必須掌握MDP建模、貝爾曼方程默寫、Q學習與SARSA偽代碼辨析,并完成教材課后基礎計算題,此為保底工程。針對學有余力者,推薦精讀SpinningUp中PPO、SAC的代碼實現,并嘗試在GYM環境中復現并調試,同時鼓勵閱讀近年頂級會議中關于離線強化學習、多智能體強化學習的綜述,形成對前沿熱點的宏觀感知。【重要】

(二)易錯點匯編與警示

教師整理歷屆學生在期末考試中失分最集中的知識點。錯誤一:混淆狀態值函數與狀態動作值函數在貝爾曼方程中的右側項。錯誤二:誤認為Q學習是學習狀態值函數。錯誤三:在策略梯度中混淆目標函數對策略參數求導與對值函數參數求導。錯誤四:將DQN中的經驗回放等同于基于模型的強化學習。教師以警示案例形式印發,并附上診斷性自測小題。【高頻考點】

(三)學科思想升華

強化學習的本質是試錯學習與延遲獎勵的數學化。復習收尾階段,教師以蘇格拉底式提問收束:若將整個人生視為一個MDP,狀態是當前能力與資源,動作是每一次選擇,獎勵是階段性成就感,折扣因子是你對未來收益的重視程度,那么你的策略是什么?是選擇貪婪地即時享樂,還是長遠規劃但面臨不確定性?學生沉默思考。教師點明:強化學習不僅是算法工具,更是決策哲學。最優策略并不總是最高累計獎勵,還需納入倫理約束與風險偏好。此環節超越應試,直指立德樹人與工程倫理,是課程思政的自然滲透。

五、形成性評價與教學反饋機制

(一)課堂即時反饋系統

每一知識模塊后嵌入微測,使用在線表單工具收集作答數據。教師重點分析錯誤選項分布,若超過三成學生落入同一干擾項,立即中斷預設流程,對該誤區進行針對性辨析。例如在Q學習更新公式測試中,若大量學生將學習率乘以當前Q值而非時序差分誤差,教師需重新拆解更新律的物理含義,并以動量法類比。【重要】

(二)課后復習效能追蹤

布置分層復習任務。必做任務包括繪制全章概念圖譜并上傳至課程論壇互評、完成題庫中三十道分類習題。選做任務為參與Kaggle經典強化學習競賽項目的復盤,撰寫技術報告。教師從概念圖譜的連通性、層級結構、跨模塊連邊數量三個維度進行質性評價,優秀作品在班級展示,形成示范輻射。

(三)教學反思與迭代方向

復習課后,教師根據學生概念圖譜中普遍缺失的連邊,識別出基于模型的強化學習在整個認知網絡中的邊緣化現象。在下輪教學中,計劃提前引入世界模型與想象回放,在初期就與

溫馨提示

  • 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
  • 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請聯系上傳者。文件的所有權益歸上傳用戶所有。
  • 3. 本站RAR壓縮包中若帶圖紙,網頁內容里面會有圖紙預覽,若沒有圖紙預覽就沒有圖紙。
  • 4. 未經權益所有人同意不得將文件中的內容挪作商業或盈利用途。
  • 5. 人人文庫網僅提供信息存儲空間,僅對用戶上傳內容的表現方式做保護處理,對用戶上傳分享的文檔內容本身不做任何修改或編輯,并不能對任何下載內容負責。
  • 6. 下載文件中如有侵權或不適當內容,請與我們聯系,我們立即糾正。
  • 7. 本站不保證下載資源的準確性、安全性和完整性, 同時也不承擔用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。

評論

0/150

提交評論