監督式學習
使用有標籤的資料訓練模型,常見任務為分類與迴歸。
非監督式學習
從無標籤資料中發現結構,例如分群(Clustering)與降維。
強化學習
代理人(Agent)透過與環境互動獲得獎勵訊號,學習最佳策略。
reward = env.step(action) # 強化學習核心迴圈
使用有標籤的資料訓練模型,常見任務為分類與迴歸。
從無標籤資料中發現結構,例如分群(Clustering)與降維。
代理人(Agent)透過與環境互動獲得獎勵訊號,學習最佳策略。
reward = env.step(action) # 強化學習核心迴圈