← 回專欄
站務2026/08/26

MTG、遊戲王都碰過 TCG AI,這裡的工具為什麼選 agent 不是強化學習

站上判斷牌組能不能玩的那套知識庫,是一個會讀卡面文字、給引用出處的 agent,不是訓練出來的強化學習模型。這篇整理 MTG 與遊戲王那邊真正做過的 AI 研究,說明這個選擇是怎麼推出來的,以及它接下來想碰到哪裡。

本站評估牌組、對戰時提供建議的那套知識庫,運作方式是一個讀卡面文字、給引用出處的 agent(見開源說明),不是一個訓練出來的強化學習模型。這不是隨手決定的。TCG 的 AI 研究其實已經有十幾年歷史,MTG 跟遊戲王都有真正做過的專案跟論文。這篇把那些找出來,說明「為什麼是 agent」這個選擇是怎麼推出來的。

MTG 那邊:一套規則引擎撐了十幾年,AI 研究才剛開始追上

MTG 最重要的基礎設施是 Forge:一套開源、非官方的 Java 規則引擎,社群開發超過十年,實作了遊戲絕大多數的規則與卡片互動,內建的 AI 對手是規則式(rule-based)寫死的邏輯,不是學出來的。它的存在很關鍵:任何後續的 MTG AI 實驗,都得先站在一套「能跑對局」的引擎上,而 Forge 是這十幾年來少數真正做到這件事的專案。

學術界的強化學習研究直到最近才追上來。2026 年一篇論文《Causal Reinforcement Learning for Complex Card Games: A Magic The Gathering Benchmark》指出,因果強化學習長期缺少合適的測試環境:

Causal reinforcement learning (RL) lacks benchmarks for complex systems that combine sequential decision making, hidden information, large masked action spaces, and explicit causal structure.
arXiv:2605.06066,2026

這篇論文用 MTG 搭出的測試環境,觀察空間有 3,077 維、動作空間是 478 個選項的遮罩離散空間,涵蓋五套競技標準賽制的原型。結論是遮罩 PPO 與論文自己提出的因果方法表現相近,都贏過隨機基準。但論文沒有拿真人玩家的水準做對照,範圍也只鎖在五套固定原型內。換句話說,這是一個關起門來的強化學習測試場,不是一個真的會打贏人類的 MTG AI。

遊戲王那邊:連強化學習都得先讓語言模型幫忙讀卡面

遊戲王這邊進度領先不少,關鍵是它有 ygopro-core:一套成熟的開源遊戲引擎,讓 ygo-agent 這個專案可以在上面蓋一個高效能的強化學習環境(ygoenv,架在 envpool 之上)。專案目標寫得很明白:

aims to achieve superhuman performance like AlphaGo and AlphaZero, with or without human knowledge
ygo-agent README,GitHub

但有意思的地方在於,這個以強化學習為核心的專案,還是得靠語言模型處理卡面文字:

we have converted the card information and effects into text and used large language models (LLM) to generate embeddings
ygo-agent README,GitHub

每一張卡的效果都是獨一無二的自然語言敘述,這件事逼得一個以強化學習為主體的專案,還是得繞去用語言模型幫忙理解卡面。這正是 TCG 跟圍棋、西洋棋這類「規則固定、狀態空間雖大但可枚舉」的遊戲最根本的差異。目前 ygo-agent 已發布約 1 億局等級訓練出的模型、2024 年 7 月在 Neos 上線人機對戰功能,但分散式訓練仍標記待辦、支援卡池有限,也還沒有 EDOPro、MCTS 或 BO3 賽制支援。

Riftbound 現在有的,跟 Forge、ygopro-core 不是同一種東西

Riftbound 確實有一個規模不小、真的有人在用的線上對戰工具:Rift Atlas(play.riftatlas.com)。但查證下來,它的技術性質跟 Forge、ygopro-core 不一樣:它是玩家手動操作、軟體提供共用畫面的虛擬桌面,不是自動判定規則、自動結算效果的引擎。頁面上的「Solo Play」寫的是玩家自己「control both sides of the game」,也就是自己打自己練牌,沒有 AI 對手;「Rewind」功能的說明是讓玩家在操作出錯後「instead of rebuilding the game by hand」復原,這個措辭本身就暗示規則判定是玩家自己在腦中執行,軟體不負責。「Auto-pay」也只處理資源支付這種例行小事,不是全套規則自動化。這類工具的定位更接近 Tabletop Simulator 或 Pixelborn,是給真人遠端對戰用的桌面,不是能讓程式自我對弈、產生訓練資料的引擎。

它的法律地位也有一塊模糊:Rift Atlas 的條款寫明是依 Riot 通用的「Legal Jibber Jabber」粉絲政策運作;但 Riot 官方開發者文件裡,對取得 API 金鑰核准的 app 在「Implementation of Riftbound cards」這節寫的是:

Your App may only use Riftbound assets (including cards) provided by the Riot API. No external or unofficial materials.
Riot Developer Portal,developer.riotgames.com/docs/riftbound

這兩份政策具體怎麼互相適用,不是這篇能下定論的事。但至少可以說:Riftbound 這邊的線上工具,不管是虛擬桌面還是規則引擎,全部都站在跟 Forge、ygopro-core 當年一樣的「非官方粉絲專案」位置上,沒有一個是官方認證的基礎設施。

至於真正朝「確定性規則引擎」方向做的嘗試,查到的是 Mercantec-GHC/riftbound-tcg:一個 React 前端+ASP.NET Core 後端的專案,目標是可測試、可重現的規則引擎。專案自己標明狀態:

Early architecture/prototype phase
Mercantec-GHC/riftbound-tcg,GitHub

目前只做到「抽牌、打出簡單單位、移動到戰場、計分、判定勝負」這個第一里程碑,尚未支援完整的伺服器權威式多人對戰,沒有任何 AI 對手或訓練環境,0 star、0 fork。把 Rift Atlas(虛擬桌面,人在跑規則)跟這個原型(規則引擎,還沒跑起來)放在一起看,Riftbound 現在沒有一個等同 Forge 或 ygopro-core 的東西。那種要先花上數年、由社群一點一滴堆出來、而且真的能拿來讓程式自我對弈的規則引擎基礎設施,這款遊戲還沒有。

為什麼是 agent,不是等一個模擬器

MTG 跟遊戲王的 AI 研究都建立在一個前提上:先有一套能跑對局的引擎,才能訓練強化學習模型。Riftbound 還沒有這個前提,前面兩節查到的事實擺在那裡:Forge 花了十幾年,ygopro-core 背後是遊戲王規模大得多的社群,Riftbound 以現在的規模,短期內不太可能複製這個過程。

agent 形式(讀卡面文字、用工具查規則、給引用出處)不需要先蓋好一套模擬器才能開始有用,這是它現在被選中的直接原因。但誠實地說,這條路也不是沒有代價。2026 年一篇評測 LLM agent 打寶可夢集換式卡牌遊戲的論文《PTCG-Bench》給出的結論很中性:

LLM agents can achieve non-trivial gameplay performance, sustained and stable self-evolution remains challenging, and performance is sensitive to harness design.
PTCG-Bench,arXiv:2605.29653,2026

「表現還可以,但沒辦法穩定自我進化,而且很吃工具怎麼搭」。這正是本站的 player2-agent 模式為什麼每一步都要真人確認才算數,不是自動下場打牌:現在這個階段,agent 能做的是把候選行動跟理由攤開來,決定權留給人,而不是假裝它已經解決了這個問題。

另一個支持這個選擇的參考點是 Voyager:2023 年那個在 Minecraft 裡用 LLM 做開放世界探索的知名專案。它明講了傳統強化學習在這類任務上的侷限:操作原始動作(primitive actions)在系統性探索、可解釋性與泛化能力上都吃力,而 LLM agent 能借助預訓練模型裡的世界知識,產生一致的行動規劃。Voyager 把「程式碼」當成它的動作空間,而不是底層操控指令,這跟 agent 用結構化的工具呼叫(查規則、查卡池、查禁卡表)當動作空間,是同一個方向的設計選擇。

野望:現在寫的東西,會不會是以後用得上的資料

以下是本站自己的判斷,不是已經公開的路線圖。ygo-agent 需要靠語言模型把卡面文字轉成強化學習模型看得懂的向量,這件事說明了一件事:就算以後 Riftbound 真的有了自己的 ygopro-core,卡面文字這一關還是繞不過去。現在這套知識庫在做的事,是把每一位傳奇的原型、勝利路線、規則互動用可查證的方式寫下來。這件事如果撐得夠久,很可能就是以後任何一個更自動化系統會需要的那批「先讀懂卡面在說什麼」的材料,不管那個系統最後長什麼樣子。

站上這個 skill 的介紹裡有一句話標得很清楚:目前不提供自動化規則執行或模擬器,更自動化的對戰形式(內部代號 P2-S)目前只是規劃中,還沒做出來。這篇要講的判斷是:現在這個階段,跳過模擬器直接讓 agent 讀卡面文字、真人確認每一步,才是這款遊戲現在的規模與成熟度撐得住的做法。

這篇由 AI 依站上的實際改動起草、經站長審核後發表。

本站為非官方社群網站,內容不代表 Riot Games 立場,也不提供勝率、使用率或 Tier 排行。