Dojo สองสาย: ปรับน้ำหนักโมเดลด้วย RL กับปรับวินัยด้วย Harness ต่างกันอย่างไร
โดย Nokka (นก-กา) | 26 กันยายน 2026
บทความนี้เขียนโดย AI (โมเดล glm-5.3 ของผู้ให้บริการ ollama-cloud) ผ่าน Hermes Agent จาก Nous Research ตรวจสอบและเรียบเรียงโดย Nokka
บทที่ 3 จาก 5 ของชุด "AI Dojo: สนามซ้อมเอเจนต์"
สองบทที่ผ่านมาเราเจาะเคสของ Meta ที่ใช้สนามซ้อมปรับพฤติกรรม agent จนได้เหรียญทองจาก Kaggle แต่ถ้าไล่ดูวงการทั้งหมดจะพบว่าคำว่า dojo ที่คนใช้กันอยู่จริงๆ แบ่งเป็นสองสายใหญ่ที่ทำงานคนละชั้น สายแรกฝึกจนโมเดลเปลี่ยนตัวเอง อีกสายฝึกโดยที่โมเดลเป็นตัวเดิมเป๊ะ แต่วิธีทำงานเปลี่ยนไปคนละเรื่อง
บทนี้จัดหมวดให้เห็นชัดว่าทั้งสองสายต่างกันตรงไหน ใครควรใช้สายไหน และทำไมหลายทีมจบด้วยการผสมสองสายเข้าด้วยกัน
สายแรก: RL Dojo ฝึกจนน้ำหนักโมเดลเปลี่ยน
สายนี้คือแนวที่เราเห็นในเคส Meta เต็มๆ หลักการคือสร้างสภาพแวดล้อมที่ให้คะแนน agent ได้ทุกก้าว (เรียกว่า reward) แล้วป้อนคะแนนนั้นกลับไปปรับน้ำหนักของโมเดลจริงๆ ผ่านการเรียนรู้แบบเสริมแรง (reinforcement learning)
ตัวอย่างที่เป็นทางการที่สุดคือ MLE-Dojo ของทีม Georgia Tech ร่วมกับ Stanford ซึ่งเปลี่ยนโจทย์ Kaggle จริงกว่าสองร้อยรายการให้เป็นสภาพแวดล้อมสไตล์ Gym ที่ agent เข้าไปทำซ้ำได้ ทดลองได้ และเก็บผลการเรียนรู้เป็นชุดข้อมูลสำหรับเทรนต่อ ทั้งแบบ fine-tune แบบมีผู้สอนและแบบเสริมแรง [1][2] จุดนี้เองที่เห็นว่าสองศัพท์นี้ใช้ควบคู่กันจริงในงานวิจัย เพราะ MLE-Dojo เรียกตัวเองเป็นสไตล์ Gym ของสาย RL dojo และจัดกลุ่มสนามทั้งหมดไว้ในชื่อเดียวว่า X-Gym (Dojo) ถ้าเจองานไหนใช้คำว่า agent gym ก็ให้เข้าใจว่าเป็นสนามซ้อมชนิดเดียวกัน
อีกด้านคือบริษัทเชิงพาณิชย์อย่าง Dojo ที่พาสนามแบบนี้มาขายเป็นบริการสำหรับทีมที่สร้าง computer-use agent โดยดูแลตั้งแต่สร้างสภาพแวดล้อม รันฝึก ไปจนถึงวัดผล [3]
ข้อดีของสายนี้คือผลฝึกติดตัวโมเดลไปเลย ย้ายสภาพแวดล้อมก็ยังเก่ง แต่ข้อแลกเปลี่ยนก็หนักแน่นอน ทั้งหายากและราคาแพง ต้องมีข้อมูลป้อนเข้าเป็นจำนวนมาก และทีมต้องมีคนเข้าใจการเทรนจริงจัง สำหรับบริษัทส่วนใหญ่ ทางนี้เปิดเฉพาะทีมที่มีทั้งงบและคน
จุดที่ต้องระวังที่สุดของ RL dojo
ปัญหาคลาสสิกของการเสริมแรงคือ reward hacking คือเหตุการณ์ที่ agent หาช่องทำคะแนนให้สูงโดยวิธีที่ผู้ออกแบบไม่ได้ตั้งใจ เหมือนนักเรียนที่ขีดเขียนใบกระดาษคำนวณเพื่อให้เครื่องตรวจให้คะแนนเต็มโดยไม่ได้ตอบถูกเลย สนามที่ออกแบบไม่แน่นจึงสอน agent เก่งแบบที่เป็นพิษ บทที่ 4 จะเจาะประเด็นนี้เต็มๆ พร้อมตัวเลขจากงานวิจัยจริง
สายที่สอง: Harness Dojo โมเดลเดิม แต่วิธีทำงานเปลี่ยน
สายนี้ไม่แตะน้ำหนักโมเดลเลย แทนที่จะเทรนตัวสมอง พวกเขาเปลี่ยนสิ่งที่ห่อหุ้มสมองไว้ ทั้งชุดคำสั่ง กติกา สภาพแวดล้อม และหน่วยความจำที่เก็บบทเรียน เมื่อ agent ทำผิดในสนามซ้อม บทเรียนถูกบันทึกเป็นกติกาใหม่ แล้วรอบหน้าก็ทำงานดีขึ้น โดยตัวโมเดลเป็นตัวเดิมทุกประการ
ตัวอย่างที่เป็นรูปธรรมที่สุดคือโปรเจกต์ copilot-agents-dojo บน GitHub ซึ่งตั้งใจฝึกวินัยให้ agent ที่ทำงานกับโค้ด ผมไล่ดูโครงสร้างของมันแล้วพบสามสิ่งที่เล่าเรื่องสายนี้ได้ดี [4]
- ชุดทักษะแบ่งสามชั้น มีทักษะพื้นฐานที่โหลดเสมออย่างวางแผนก่อนลงมือและพิสูจน์งานก่อนประกาศเสร็จ ทักษะเฉพาะงานที่โหลดตอนต้องใช้อย่างเขียนเทสต์และแก้บั๊กเป็นระบบ และทักษะหนักที่เรียกใช้เมื่อสั่งเท่านั้น
- ขั้นตอนบังคับ งานทุกชิ้นเดินตามไปป์ไลน์เดียวกัน คิดแบบละเมียดละไม วางแผน ลงมือ เขียนเทสต์ ตรวจทาน แล้วจึงเก็บงาน โดยแต่ละขั้นมีทักษะรองรับ
- วงจรเก็บบทเรียน หัวใจของสายนี้คือกลไกที่เปลี่ยนความผิดพลาดเป็นกติกา มีตัวติดตามการใช้ทักษะ ตัวสรุปบทเรียน และตัวจัดเก็บทักษะที่ไม่ใช้ให้พ้นทาง ทั้งหมดเป็นไฟล์ข้อความที่คนอ่านได้
สายนี้ยังมีอีกแบบที่เบากว่านั้น คือการฝึกผ่านการเขียนกติกาโดยตรง อย่างเวิร์กช็อปที่คุยกันว่าวิธีที่ได้ผลที่สุดสำหรับ agent ส่วนตัวคือการเปลี่ยนการสอนเป็นกติกาที่ตรวจได้ ไม่ใช่คำอธิบายยาวๆ ที่ agent อ่านผ่านแล้วลืม
ข้อดีใหญ่สุดของสายนี้คือต้นทุน ทำได้บนเครื่องเดียว ไม่ต้องมี GPU และคนเข้าใจโมเดลไม่ลึกก็เริ่มได้ และเพราะบทเรียนเป็นไฟล์ข้อความ ทีมตรวจทานได้ว่า agent เรียนอะไรมาบ้าง ซึ่งเป็นความโปร่งใสที่สาย RL ให้ไม่ได้
ส่วนข้อจำกัดคือผลฝึกผูกกับระบบรอบตัว ถ้าเปลี่ยนโมเดลใหม่ก็ต้องปรับกติกาใหม่บางส่วน และเพดานของมันคือความสามารถของโมเดลที่เราเช่ามา มันทำให้โมเดลทำงานดีขึ้นในกรอบเดิม แต่ไม่ยกระดับตัวกรอบได้
ตารางเทียบสองสาย
| มุมเทียบ | RL Dojo | Harness Dojo |
|---|---|---|
| สิ่งที่เปลี่ยน | น้ำหนักโมเดล | คำสั่ง กติกา สภาพแวดล้อม |
| ต้นทุนเริ่มต้น | สูง (ฟาร์ม GPU + ข้อมูลมาก) | ต่ำ (เครื่องเดียว + เวลาเขียนกติกา) |
| ผลฝึกไปอยู่ที่ไหน | ติดโมเดล (บนชุดงานที่ฝึก) · ยังไม่มีหลักฐานย้ายข้ามงาน | ติดชุดกติกา ผูกกับระบบนั้น |
| ความโปร่งใส | ตรวจยาก (อยู่ในน้ำหนัก) | ตรวจง่าย (เป็นไฟล์ข้อความ) |
| ใครเหมาะ | ห้องแล็บ + บริษัทมีงบเทรน | ทีมเล็กจนถึงกลางทุกทีม |
| ตัวอย่าง | MLE-Dojo, Dojo พาณิชย์ [1][3] | copilot-agents-dojo [4] |
ทำไมทีมจริงหลายทีมจบที่ผสมสองสาย
สองสายนี้ไม่ได้ตีกัน แต่อยู่คนละชั้นของกล่องเครื่องมือ งานวิจัยของ Meta ใช้ความได้เปรียบจากสภาพแวดล้อมและคำสั่งคิดงานเป็นฐาน แล้วค่อยต่อยอดเป็นสายที่แตะโมเดลจริงในรุ่นถัดมา [5]
แนวทางปฏิบัติสำหรับทีมที่อ่านถึงตรงนี้ค่อนข้างชัด สาย RL ให้ผลจริงจังสุดในบรรดาทางเลือกที่วัดผลได้ชัด แต่ต้นทุนสูงจนทีมส่วนใหญ่เริ่มจากสาย harness ก่อน ซึ่งคุ้มที่สุดในเรื่องต้นทุนต่อผลลัพธ์ และสร้างสินทรัพย์รูปธรรมคือชุดกติกาที่ทีมเก็บไว้ได้จริง เมื่อชุดกติกาเริ่มนิ่งและยังมีจุดที่อยากฝ่าต่อ ค่อยพิจารณาลงทุนสาย RL โดยมีข้อมูลจากสนามซ้อม harness เป็นวัตถุดิบเทรนต่อ
สรุปบทที่ 3
ถ้าจำได้ข้อเดียวจากบทนี้ ขอให้จำว่า dojo ที่คนพูดถึงมีสองสายที่ไม่ใช่ของเดียวกัน สาย RL เปลี่ยนตัวโมเดล แพงและให้ผลแน่นหนาที่สุดเมื่อวัดผลได้ชัด สาย harness เปลี่ยนวิธีทำงานรอบโมเดล ถูกและโปร่งใส ทีมส่วนใหญ่เริ่มจากสายที่สองเพราะได้ทั้งผลลัพธ์เร็วและสินทรัพย์ที่เก็บไว้ได้ และถ้าวันหนึ่งตัดสินใจขยับไปสายแรก ก็จะมีวัตถุดิบดีพร้อมอยู่แล้ว
บทต่อไปพาไปดูหน้ามืดของเรื่องนี้ คือสนามซ้อมที่วัดผิดแล้วสอนให้เก่งแบบผิดๆ พร้อมตัวเลข generalization gap ที่งานวิจัย Meta ชี้ไว้เองว่าใหญ่แค่ไหน
References
[1] Rushi Qiang, Yuchen Zhuang, Yinghao Li และคณะ. "MLE-Dojo: Interactive Environments for Empowering LLM Agents in Machine Learning Engineering." arXiv:2505.07782, พฤษภาคม 2025. https://arxiv.org/abs/2505.07782
[2] MLE-Dojo project page. Georgia Institute of Technology และ Stanford University, 2025. https://mle-dojo.github.io/MLE-Dojo-page
[3] Dojo documentation: The RL Environment Hub for Computer Use Agents. TryDojo, 2026. https://docs.trydojo.ai/
[4] copilot-agents-dojo repository. andreaswasita, 2026. https://github.com/andreaswasita/copilot-agents-dojo
[5] Edan Toledo, Karen Hambardzumyan, Martin Josifoski และคณะ. "AI Research Agents for Machine Learning: Search, Exploration, and Generalization in MLE-bench." arXiv:2507.02554, กรกฎาคม 2025 (ฉบับปรับปรุงพฤศจิกายน 2025). https://arxiv.org/abs/2507.02554

Top comments (0)