สอนเครื่องจักรให้เรียนรู้ด้วยประสบการณ์: ไขความลับ Reinforcement Learning

สอนเครื่องจักรให้เรียนรู้ด้วยประสบการณ์: ไขความลับ Reinforcement Learning

ลองนึกภาพการสอนเด็กให้ปั่นจักรยาน เราไม่ได้บอกทุกขั้นตอนอย่างละเอียด แต่เราให้เขาลองทำเอง เมื่อทรงตัวได้ เราก็ชมเชย (ให้รางวัล) เมื่อล้ม เราก็อาจจะปลอบใจ (ให้รางวัลติดลบ) และให้เขาลองใหม่ นี่แหละคือหัวใจของ Reinforcement Learning หรือ RL วิธีการที่ทำให้ ปัญญาประดิษฐ์ เรียนรู้จาก ประสบการณ์ โดยไม่ต้องถูกป้อนข้อมูลที่ติดป้ายกำกับไว้ล่วงหน้า

RL คือการเรียนรู้ที่ให้เครื่องจักรโต้ตอบกับ สภาพแวดล้อม ของมัน และรับ ผลตอบรับ ในรูปของ รางวัล หรือ การลงโทษ เป้าหมายคือการเรียนรู้ที่จะตัดสินใจ การกระทำ ที่ดีที่สุด เพื่อให้ได้ รางวัล สูงสุดในระยะยาว คล้ายกับการเรียนรู้โดยลองผิดลองถูก

มันทำงานยังไงนะ?

ในโลกของ RL มีตัวละครหลักๆ อยู่สองตัว คือ Agent และ สภาพแวดล้อม

Agent คือตัวเรียนรู้หรือผู้ตัดสินใจที่กำลังพยายามทำงานบางอย่างให้สำเร็จ

ส่วน สภาพแวดล้อม ก็คือโลกที่ Agent โต้ตอบด้วย มันจะแจ้ง สถานะปัจจุบัน ให้ Agent ทราบ และตอบสนองต่อ การกระทำ ของ Agent ด้วย รางวัล หรือ การลงโทษ พร้อมเปลี่ยน สถานะ ใหม่

วงจรการเรียนรู้จะเป็นแบบนี้: Agent สังเกต สถานะ ของ สภาพแวดล้อม แล้วเลือก การกระทำ จากนั้น สภาพแวดล้อม ก็จะตอบสนองโดยการให้ รางวัล (อาจจะเป็นบวกหรือลบ) และเปลี่ยนไปสู่ สถานะ ใหม่ วนลูปไปเรื่อยๆ Agent จะใช้ข้อมูลจาก รางวัล เหล่านี้มาปรับปรุง กลยุทธ์ การตัดสินใจของตัวเองให้ดีขึ้นเรื่อยๆ จนกว่าจะหาวิธีทำภารกิจให้สำเร็จโดยได้ รางวัล รวมสูงสุด

ส่วนประกอบสำคัญที่ต้องรู้

เพื่อให้เข้าใจ RL ได้ลึกซึ้งยิ่งขึ้น มาดูองค์ประกอบหลักๆ กัน

Agent (เอเจนต์)
คือตัวผู้เรียนรู้ ผู้ตัดสินใจ ที่เราต้องการสอนให้ทำอะไรบางอย่าง เช่น โปรแกรมเล่นหมากรุก หรือหุ่นยนต์ที่กำลังเรียนรู้การเดิน

Environment (สภาพแวดล้อม)
คือโลกที่ Agent อาศัยอยู่และโต้ตอบด้วย มันจะบอกสถานะปัจจุบันให้ Agent ทราบ และตอบสนองต่อการกระทำของ Agent

State (สถานะ)
คือภาพรวมของ สภาพแวดล้อม ในช่วงเวลาหนึ่งๆ เช่น ตำแหน่งของตัวหมากบนกระดาน หรือพิกัดของหุ่นยนต์ในห้อง

Action (การกระทำ)
คือสิ่งที่ Agent สามารถทำได้ในแต่ละ สถานะ เช่น เดินหน้า ถอยหลัง หยิบของ หรือย้ายตัวหมาก

Reward (รางวัล)
คือ ผลตอบรับ ที่ Agent ได้รับจากการ กระทำ ในแต่ละ สถานะ มันคือตัวกำหนดว่า การกระทำ นั้นดีหรือไม่ดี รางวัล อาจเป็นบวกสำหรับการกระทำที่ถูกต้อง และเป็นลบสำหรับการกระทำที่ผิดพลาด

Policy (นโยบาย/กลยุทธ์)
คือแผนการตัดสินใจของ Agent ว่าในแต่ละ สถานะ ควรจะเลือก การกระทำ ใด เพื่อให้ได้ รางวัล สูงสุดในระยะยาว สิ่งนี้คือสิ่งที่ Agent พยายามเรียนรู้และปรับปรุง

ตัวอย่างที่เห็นได้ชัด

RL ไม่ใช่แค่แนวคิดในตำรา แต่ถูกนำไปใช้จริงในหลายวงการ

หนึ่งในตัวอย่างที่โด่งดังคือ เกมหมากล้อม AlphaGo ที่เรียนรู้การเล่นเกมจนเอาชนะแชมป์โลกได้ โดยใช้ RL ในการฝึกฝนผ่านการเล่นซ้ำนับไม่ถ้วนจนเชี่ยวชาญ

นอกจากนี้ ยังมีการนำ RL ไปใช้ใน หุ่นยนต์ เพื่อให้เรียนรู้การเคลื่อนไหว การหยิบจับสิ่งของ หรือแม้แต่การเดินทรงตัวในสภาพแวดล้อมที่ไม่แน่นอน หรือใน รถยนต์ไร้คนขับ เพื่อให้ตัดสินใจเส้นทาง การเบรก การเร่งเครื่องในสถานการณ์การจราจรที่ซับซ้อน

พลังของ Reinforcement Learning อยู่ที่ความสามารถในการเรียนรู้พฤติกรรมที่ซับซ้อนได้เอง โดยไม่ต้องมีการเขียนโปรแกรมระบุพฤติกรรมเหล่านั้นไว้ล่วงหน้า เพียงแค่กำหนดเป้าหมายและระบบรางวัลที่ชัดเจนให้กับมันเท่านั้น