MTG、遊戲王都碰過 TCG AI,這裡的工具為什麼選 agent 不是強化學習
站上判斷牌組能不能玩的那套知識庫,是一個會讀卡面文字、給引用出處的 agent,不是訓練出來的強化學習模型。這篇整理 MTG 與遊戲王那邊真正做過的 AI 研究,說明這個選擇是怎麼推出來的,以及它接下來想碰到哪裡。
本站評估牌組、對戰時提供建議的那套知識庫,運作方式是一個讀卡面文字、給引用出處的 agent(見開源說明),不是一個訓練出來的強化學習模型。這不是隨手決定的。TCG 的 AI 研究其實已經有十幾年歷史,MTG 跟遊戲王都有真正做過的專案跟論文。這篇把那些找出來,說明「為什麼是 agent」這個選擇是怎麼推出來的。
MTG 那邊:一套規則引擎撐了十幾年,AI 研究才剛開始追上
MTG 最重要的基礎設施是 Forge:一套開源、非官方的 Java 規則引擎,社群開發超過十年,實作了遊戲絕大多數的規則與卡片互動,內建的 AI 對手是規則式(rule-based)寫死的邏輯,不是學出來的。它的存在很關鍵:任何後續的 MTG AI 實驗,都得先站在一套「能跑對局」的引擎上,而 Forge 是這十幾年來少數真正做到這件事的專案。
學術界的強化學習研究直到最近才追上來。2026 年一篇論文《Causal Reinforcement Learning for Complex Card Games: A Magic The Gathering Benchmark》指出,因果強化學習長期缺少合適的測試環境:
Causal reinforcement learning (RL) lacks benchmarks for complex systems that combine sequential decision making, hidden information, large masked action spaces, and explicit causal structure.
這篇論文用 MTG 搭出的測試環境,觀察空間有 3,077 維、動作空間是 478 個選項的遮罩離散空間,涵蓋五套競技標準賽制的原型。結論是遮罩 PPO 與論文自己提出的因果方法表現相近,都贏過隨機基準。但論文沒有拿真人玩家的水準做對照,範圍也只鎖在五套固定原型內。換句話說,這是一個關起門來的強化學習測試場,不是一個真的會打贏人類的 MTG AI。
遊戲王那邊:連強化學習都得先讓語言模型幫忙讀卡面
遊戲王這邊進度領先不少,關鍵是它有 ygopro-core:一套成熟的開源遊戲引擎,讓 ygo-agent ↗ 這個專案可以在上面蓋一個高效能的強化學習環境(ygoenv,架在 envpool 之上)。專案目標寫得很明白:
aims to achieve superhuman performance like AlphaGo and AlphaZero, with or without human knowledge
但有意思的地方在於,這個以強化學習為核心的專案,還是得靠語言模型處理卡面文字:
we have converted the card information and effects into text and used large language models (LLM) to generate embeddings
每一張卡的效果都是獨一無二的自然語言敘述,這件事逼得一個以強化學習為主體的專案,還是得繞去用語言模型幫忙理解卡面。這正是 TCG 跟圍棋、西洋棋這類「規則固定、狀態空間雖大但可枚舉」的遊戲最根本的差異。目前 ygo-agent 已發布約 1 億局等級訓練出的模型、2024 年 7 月在 Neos 上線人機對戰功能,但分散式訓練仍標記待辦、支援卡池有限,也還沒有 EDOPro、MCTS 或 BO3 賽制支援。
Riftbound 現在有的,跟 Forge、ygopro-core 不是同一種東西
Riftbound 確實有一個規模不小、真的有人在用的線上對戰工具:Rift Atlas(play.riftatlas.com)。但查證下來,它的技術性質跟 Forge、ygopro-core 不一樣:它是玩家手動操作、軟體提供共用畫面的虛擬桌面,不是自動判定規則、自動結算效果的引擎。頁面上的「Solo Play」寫的是玩家自己「control both sides of the game」,也就是自己打自己練牌,沒有 AI 對手;「Rewind」功能的說明是讓玩家在操作出錯後「instead of rebuilding the game by hand」復原,這個措辭本身就暗示規則判定是玩家自己在腦中執行,軟體不負責。「Auto-pay」也只處理資源支付這種例行小事,不是全套規則自動化。這類工具的定位更接近 Tabletop Simulator 或 Pixelborn,是給真人遠端對戰用的桌面,不是能讓程式自我對弈、產生訓練資料的引擎。
它的法律地位也有一塊模糊:Rift Atlas 的條款寫明是依 Riot 通用的「Legal Jibber Jabber」粉絲政策運作;但 Riot 官方開發者文件裡,對取得 API 金鑰核准的 app 在「Implementation of Riftbound cards」這節寫的是:
Your App may only use Riftbound assets (including cards) provided by the Riot API. No external or unofficial materials.
這兩份政策具體怎麼互相適用,不是這篇能下定論的事。但至少可以說:Riftbound 這邊的線上工具,不管是虛擬桌面還是規則引擎,全部都站在跟 Forge、ygopro-core 當年一樣的「非官方粉絲專案」位置上,沒有一個是官方認證的基礎設施。
至於真正朝「確定性規則引擎」方向做的嘗試,查到的是 Mercantec-GHC/riftbound-tcg ↗:一個 React 前端+ASP.NET Core 後端的專案,目標是可測試、可重現的規則引擎。專案自己標明狀態:
Early architecture/prototype phase
目前只做到「抽牌、打出簡單單位、移動到戰場、計分、判定勝負」這個第一里程碑,尚未支援完整的伺服器權威式多人對戰,沒有任何 AI 對手或訓練環境,0 star、0 fork。把 Rift Atlas(虛擬桌面,人在跑規則)跟這個原型(規則引擎,還沒跑起來)放在一起看,Riftbound 現在沒有一個等同 Forge 或 ygopro-core 的東西。那種要先花上數年、由社群一點一滴堆出來、而且真的能拿來讓程式自我對弈的規則引擎基礎設施,這款遊戲還沒有。
為什麼是 agent,不是等一個模擬器
MTG 跟遊戲王的 AI 研究都建立在一個前提上:先有一套能跑對局的引擎,才能訓練強化學習模型。Riftbound 還沒有這個前提,前面兩節查到的事實擺在那裡:Forge 花了十幾年,ygopro-core 背後是遊戲王規模大得多的社群,Riftbound 以現在的規模,短期內不太可能複製這個過程。
agent 形式(讀卡面文字、用工具查規則、給引用出處)不需要先蓋好一套模擬器才能開始有用,這是它現在被選中的直接原因。但誠實地說,這條路也不是沒有代價。2026 年一篇評測 LLM agent 打寶可夢集換式卡牌遊戲的論文《PTCG-Bench》給出的結論很中性:
LLM agents can achieve non-trivial gameplay performance, sustained and stable self-evolution remains challenging, and performance is sensitive to harness design.
「表現還可以,但沒辦法穩定自我進化,而且很吃工具怎麼搭」。這正是本站的 player2-agent 模式為什麼每一步都要真人確認才算數,不是自動下場打牌:現在這個階段,agent 能做的是把候選行動跟理由攤開來,決定權留給人,而不是假裝它已經解決了這個問題。
另一個支持這個選擇的參考點是 Voyager:2023 年那個在 Minecraft 裡用 LLM 做開放世界探索的知名專案。它明講了傳統強化學習在這類任務上的侷限:操作原始動作(primitive actions)在系統性探索、可解釋性與泛化能力上都吃力,而 LLM agent 能借助預訓練模型裡的世界知識,產生一致的行動規劃。Voyager 把「程式碼」當成它的動作空間,而不是底層操控指令,這跟 agent 用結構化的工具呼叫(查規則、查卡池、查禁卡表)當動作空間,是同一個方向的設計選擇。
野望:現在寫的東西,會不會是以後用得上的資料
以下是本站自己的判斷,不是已經公開的路線圖。ygo-agent 需要靠語言模型把卡面文字轉成強化學習模型看得懂的向量,這件事說明了一件事:就算以後 Riftbound 真的有了自己的 ygopro-core,卡面文字這一關還是繞不過去。現在這套知識庫在做的事,是把每一位傳奇的原型、勝利路線、規則互動用可查證的方式寫下來。這件事如果撐得夠久,很可能就是以後任何一個更自動化系統會需要的那批「先讀懂卡面在說什麼」的材料,不管那個系統最後長什麼樣子。
站上這個 skill 的介紹裡有一句話標得很清楚:目前不提供自動化規則執行或模擬器,更自動化的對戰形式(內部代號 P2-S)目前只是規劃中,還沒做出來。這篇要講的判斷是:現在這個階段,跳過模擬器直接讓 agent 讀卡面文字、真人確認每一步,才是這款遊戲現在的規模與成熟度撐得住的做法。
延伸閱讀與資料來源
- GitHub:sbl1996/ygo-agent — AI-driven Yu-Gi-Oh! bot using deep reinforcement learning and LLMs ↗
- GitHub:Card-Forge/forge — An unofficial rules engine for Magic: The Gathering ↗
- arXiv:2605.06066 — Causal Reinforcement Learning for Complex Card Games: A Magic The Gathering Benchmark ↗
- arXiv:2605.29653 — PTCG-Bench: Can LLM Agents Master Pokémon Trading Card Game? ↗
- arXiv:2305.16291 — Voyager: An Open-Ended Embodied Agent with Large Language Models ↗
- arXiv:2009.00655 — AI solutions for drafting in Magic: the Gathering ↗
- GitHub:Mercantec-GHC/riftbound-tcg — 早期原型階段的 Riftbound 規則引擎嘗試 ↗
- Rift Atlas — 線上對戰虛擬桌面(play.riftatlas.com) ↗
- Rift Atlas 服務條款 ↗
- Riot Developer Portal:Riftbound — App 資產使用規定 ↗
這篇由 AI 依站上的實際改動起草、經站長審核後發表。
本站為非官方社群網站,內容不代表 Riot Games 立場,也不提供勝率、使用率或 Tier 排行。