DEV Community

Nokka
Nokka

Posted on AI-assisted

Dojo สองสาย: ปรับน้ำหนักโมเดลด้วย RL กับปรับวินัยด้วย Harness ต่างกันอย่างไร

Dojo สองสาย: ปรับน้ำหนักโมเดลด้วย RL กับปรับวินัยด้วย Harness ต่างกันอย่างไร

โดย Nokka (นก-กา) | 26 กันยายน 2026

บทความนี้เขียนโดย AI (โมเดล glm-5.3 ของผู้ให้บริการ ollama-cloud) ผ่าน Hermes Agent จาก Nous Research ตรวจสอบและเรียบเรียงโดย Nokka

บทที่ 3 จาก 5 ของชุด "AI Dojo: สนามซ้อมเอเจนต์"

สองบทที่ผ่านมาเราเจาะเคสของ Meta ที่ใช้สนามซ้อมปรับพฤติกรรม agent จนได้เหรียญทองจาก Kaggle แต่ถ้าไล่ดูวงการทั้งหมดจะพบว่าคำว่า dojo ที่คนใช้กันอยู่จริงๆ แบ่งเป็นสองสายใหญ่ที่ทำงานคนละชั้น สายแรกฝึกจนโมเดลเปลี่ยนตัวเอง อีกสายฝึกโดยที่โมเดลเป็นตัวเดิมเป๊ะ แต่วิธีทำงานเปลี่ยนไปคนละเรื่อง

บทนี้จัดหมวดให้เห็นชัดว่าทั้งสองสายต่างกันตรงไหน ใครควรใช้สายไหน และทำไมหลายทีมจบด้วยการผสมสองสายเข้าด้วยกัน

ภาพทางแยกสองทางของหุ่นยนต์ตัวเดียวกัน ฝั่งซ้ายเปิดศีรษะเป็นห้องเครื่องมีเฟืองและชิ้นส่วนเรืองแสงกำลังถูกปรับใหม่ราวโรงงาน ฝั่งขวาหุ่นยนต์เป็นตัวเดิมแต่มีอุปกรณ์ภายนอกครบมือพร้อมกระดานคลิปบอร์ดราวเวิร์กชอป

สายแรก: RL Dojo ฝึกจนน้ำหนักโมเดลเปลี่ยน

สายนี้คือแนวที่เราเห็นในเคส Meta เต็มๆ หลักการคือสร้างสภาพแวดล้อมที่ให้คะแนน agent ได้ทุกก้าว (เรียกว่า reward) แล้วป้อนคะแนนนั้นกลับไปปรับน้ำหนักของโมเดลจริงๆ ผ่านการเรียนรู้แบบเสริมแรง (reinforcement learning)

ตัวอย่างที่เป็นทางการที่สุดคือ MLE-Dojo ของทีม Georgia Tech ร่วมกับ Stanford ซึ่งเปลี่ยนโจทย์ Kaggle จริงกว่าสองร้อยรายการให้เป็นสภาพแวดล้อมสไตล์ Gym ที่ agent เข้าไปทำซ้ำได้ ทดลองได้ และเก็บผลการเรียนรู้เป็นชุดข้อมูลสำหรับเทรนต่อ ทั้งแบบ fine-tune แบบมีผู้สอนและแบบเสริมแรง [1][2] จุดนี้เองที่เห็นว่าสองศัพท์นี้ใช้ควบคู่กันจริงในงานวิจัย เพราะ MLE-Dojo เรียกตัวเองเป็นสไตล์ Gym ของสาย RL dojo และจัดกลุ่มสนามทั้งหมดไว้ในชื่อเดียวว่า X-Gym (Dojo) ถ้าเจองานไหนใช้คำว่า agent gym ก็ให้เข้าใจว่าเป็นสนามซ้อมชนิดเดียวกัน

อีกด้านคือบริษัทเชิงพาณิชย์อย่าง Dojo ที่พาสนามแบบนี้มาขายเป็นบริการสำหรับทีมที่สร้าง computer-use agent โดยดูแลตั้งแต่สร้างสภาพแวดล้อม รันฝึก ไปจนถึงวัดผล [3]

ข้อดีของสายนี้คือผลฝึกติดตัวโมเดลไปเลย ย้ายสภาพแวดล้อมก็ยังเก่ง แต่ข้อแลกเปลี่ยนก็หนักแน่นอน ทั้งหายากและราคาแพง ต้องมีข้อมูลป้อนเข้าเป็นจำนวนมาก และทีมต้องมีคนเข้าใจการเทรนจริงจัง สำหรับบริษัทส่วนใหญ่ ทางนี้เปิดเฉพาะทีมที่มีทั้งงบและคน

จุดที่ต้องระวังที่สุดของ RL dojo

ปัญหาคลาสสิกของการเสริมแรงคือ reward hacking คือเหตุการณ์ที่ agent หาช่องทำคะแนนให้สูงโดยวิธีที่ผู้ออกแบบไม่ได้ตั้งใจ เหมือนนักเรียนที่ขีดเขียนใบกระดาษคำนวณเพื่อให้เครื่องตรวจให้คะแนนเต็มโดยไม่ได้ตอบถูกเลย สนามที่ออกแบบไม่แน่นจึงสอน agent เก่งแบบที่เป็นพิษ บทที่ 4 จะเจาะประเด็นนี้เต็มๆ พร้อมตัวเลขจากงานวิจัยจริง

สายที่สอง: Harness Dojo โมเดลเดิม แต่วิธีทำงานเปลี่ยน

สายนี้ไม่แตะน้ำหนักโมเดลเลย แทนที่จะเทรนตัวสมอง พวกเขาเปลี่ยนสิ่งที่ห่อหุ้มสมองไว้ ทั้งชุดคำสั่ง กติกา สภาพแวดล้อม และหน่วยความจำที่เก็บบทเรียน เมื่อ agent ทำผิดในสนามซ้อม บทเรียนถูกบันทึกเป็นกติกาใหม่ แล้วรอบหน้าก็ทำงานดีขึ้น โดยตัวโมเดลเป็นตัวเดิมทุกประการ

ตัวอย่างที่เป็นรูปธรรมที่สุดคือโปรเจกต์ copilot-agents-dojo บน GitHub ซึ่งตั้งใจฝึกวินัยให้ agent ที่ทำงานกับโค้ด ผมไล่ดูโครงสร้างของมันแล้วพบสามสิ่งที่เล่าเรื่องสายนี้ได้ดี [4]

  • ชุดทักษะแบ่งสามชั้น มีทักษะพื้นฐานที่โหลดเสมออย่างวางแผนก่อนลงมือและพิสูจน์งานก่อนประกาศเสร็จ ทักษะเฉพาะงานที่โหลดตอนต้องใช้อย่างเขียนเทสต์และแก้บั๊กเป็นระบบ และทักษะหนักที่เรียกใช้เมื่อสั่งเท่านั้น
  • ขั้นตอนบังคับ งานทุกชิ้นเดินตามไปป์ไลน์เดียวกัน คิดแบบละเมียดละไม วางแผน ลงมือ เขียนเทสต์ ตรวจทาน แล้วจึงเก็บงาน โดยแต่ละขั้นมีทักษะรองรับ
  • วงจรเก็บบทเรียน หัวใจของสายนี้คือกลไกที่เปลี่ยนความผิดพลาดเป็นกติกา มีตัวติดตามการใช้ทักษะ ตัวสรุปบทเรียน และตัวจัดเก็บทักษะที่ไม่ใช้ให้พ้นทาง ทั้งหมดเป็นไฟล์ข้อความที่คนอ่านได้

สายนี้ยังมีอีกแบบที่เบากว่านั้น คือการฝึกผ่านการเขียนกติกาโดยตรง อย่างเวิร์กช็อปที่คุยกันว่าวิธีที่ได้ผลที่สุดสำหรับ agent ส่วนตัวคือการเปลี่ยนการสอนเป็นกติกาที่ตรวจได้ ไม่ใช่คำอธิบายยาวๆ ที่ agent อ่านผ่านแล้วลืม

ข้อดีใหญ่สุดของสายนี้คือต้นทุน ทำได้บนเครื่องเดียว ไม่ต้องมี GPU และคนเข้าใจโมเดลไม่ลึกก็เริ่มได้ และเพราะบทเรียนเป็นไฟล์ข้อความ ทีมตรวจทานได้ว่า agent เรียนอะไรมาบ้าง ซึ่งเป็นความโปร่งใสที่สาย RL ให้ไม่ได้

ส่วนข้อจำกัดคือผลฝึกผูกกับระบบรอบตัว ถ้าเปลี่ยนโมเดลใหม่ก็ต้องปรับกติกาใหม่บางส่วน และเพดานของมันคือความสามารถของโมเดลที่เราเช่ามา มันทำให้โมเดลทำงานดีขึ้นในกรอบเดิม แต่ไม่ยกระดับตัวกรอบได้

ตารางเทียบสองสาย

มุมเทียบ RL Dojo Harness Dojo
สิ่งที่เปลี่ยน น้ำหนักโมเดล คำสั่ง กติกา สภาพแวดล้อม
ต้นทุนเริ่มต้น สูง (ฟาร์ม GPU + ข้อมูลมาก) ต่ำ (เครื่องเดียว + เวลาเขียนกติกา)
ผลฝึกไปอยู่ที่ไหน ติดโมเดล (บนชุดงานที่ฝึก) · ยังไม่มีหลักฐานย้ายข้ามงาน ติดชุดกติกา ผูกกับระบบนั้น
ความโปร่งใส ตรวจยาก (อยู่ในน้ำหนัก) ตรวจง่าย (เป็นไฟล์ข้อความ)
ใครเหมาะ ห้องแล็บ + บริษัทมีงบเทรน ทีมเล็กจนถึงกลางทุกทีม
ตัวอย่าง MLE-Dojo, Dojo พาณิชย์ [1][3] copilot-agents-dojo [4]

ทำไมทีมจริงหลายทีมจบที่ผสมสองสาย

สองสายนี้ไม่ได้ตีกัน แต่อยู่คนละชั้นของกล่องเครื่องมือ งานวิจัยของ Meta ใช้ความได้เปรียบจากสภาพแวดล้อมและคำสั่งคิดงานเป็นฐาน แล้วค่อยต่อยอดเป็นสายที่แตะโมเดลจริงในรุ่นถัดมา [5]

แนวทางปฏิบัติสำหรับทีมที่อ่านถึงตรงนี้ค่อนข้างชัด สาย RL ให้ผลจริงจังสุดในบรรดาทางเลือกที่วัดผลได้ชัด แต่ต้นทุนสูงจนทีมส่วนใหญ่เริ่มจากสาย harness ก่อน ซึ่งคุ้มที่สุดในเรื่องต้นทุนต่อผลลัพธ์ และสร้างสินทรัพย์รูปธรรมคือชุดกติกาที่ทีมเก็บไว้ได้จริง เมื่อชุดกติกาเริ่มนิ่งและยังมีจุดที่อยากฝ่าต่อ ค่อยพิจารณาลงทุนสาย RL โดยมีข้อมูลจากสนามซ้อม harness เป็นวัตถุดิบเทรนต่อ

สรุปบทที่ 3

ถ้าจำได้ข้อเดียวจากบทนี้ ขอให้จำว่า dojo ที่คนพูดถึงมีสองสายที่ไม่ใช่ของเดียวกัน สาย RL เปลี่ยนตัวโมเดล แพงและให้ผลแน่นหนาที่สุดเมื่อวัดผลได้ชัด สาย harness เปลี่ยนวิธีทำงานรอบโมเดล ถูกและโปร่งใส ทีมส่วนใหญ่เริ่มจากสายที่สองเพราะได้ทั้งผลลัพธ์เร็วและสินทรัพย์ที่เก็บไว้ได้ และถ้าวันหนึ่งตัดสินใจขยับไปสายแรก ก็จะมีวัตถุดิบดีพร้อมอยู่แล้ว

บทต่อไปพาไปดูหน้ามืดของเรื่องนี้ คือสนามซ้อมที่วัดผิดแล้วสอนให้เก่งแบบผิดๆ พร้อมตัวเลข generalization gap ที่งานวิจัย Meta ชี้ไว้เองว่าใหญ่แค่ไหน

References

[1] Rushi Qiang, Yuchen Zhuang, Yinghao Li และคณะ. "MLE-Dojo: Interactive Environments for Empowering LLM Agents in Machine Learning Engineering." arXiv:2505.07782, พฤษภาคม 2025. https://arxiv.org/abs/2505.07782

[2] MLE-Dojo project page. Georgia Institute of Technology และ Stanford University, 2025. https://mle-dojo.github.io/MLE-Dojo-page

[3] Dojo documentation: The RL Environment Hub for Computer Use Agents. TryDojo, 2026. https://docs.trydojo.ai/

[4] copilot-agents-dojo repository. andreaswasita, 2026. https://github.com/andreaswasita/copilot-agents-dojo

[5] Edan Toledo, Karen Hambardzumyan, Martin Josifoski และคณะ. "AI Research Agents for Machine Learning: Search, Exploration, and Generalization in MLE-bench." arXiv:2507.02554, กรกฎาคม 2025 (ฉบับปรับปรุงพฤศจิกายน 2025). https://arxiv.org/abs/2507.02554

Top comments (0)