AI เรียนรู้: ไม่ใช่การฝึกฝน แต่เป็น ‘การแยกส่วนข้อมูล’ ที่ทำให้เกิดปัญหาลิขสิทธิ์

AI เรียนรู้: ไม่ใช่การฝึกฝน แต่เป็น ‘การแยกส่วนข้อมูล’ ที่ทำให้เกิดปัญหาลิขสิทธิ์

วงการปัญญาประดิษฐ์กำลังร้อนแรง การถกเถียงเรื่อง ลิขสิทธิ์ และ การใช้งานโดยชอบธรรม (Fair Use) ในการนำข้อมูลมหาศาลมาใช้ฝึกฝนโมเดล AI เป็นประเด็นที่พูดถึงกันไม่หยุด หลายคนเชื่อว่าการที่ AI นำโค้ด บทความ หรือรูปภาพไป “เรียนรู้” ไม่ได้เป็นการละเมิดลิขสิทธิ์โดยตรง เพราะมันไม่ได้ลอกเลียนแบบออกมาทั้งดุ้น แต่มันเรียนรู้ “แพทเทิร์น” และสร้างสรรค์สิ่งใหม่ขึ้นมา

ทว่า แนวคิดนี้อาจพลาดจุดสำคัญไป เพราะปัญหาที่แท้จริงอาจไม่ได้อยู่ที่ตัวกระบวนการฝึกฝนโมเดล AI โดยตรง แต่ซ่อนอยู่ในขั้นตอนเล็ก ๆ ที่เรียกว่า การแยกส่วนข้อมูล (Tokenization) ซึ่งหลายคนมองข้ามไป

AI ฝึกฝน: การละเมิดลิขสิทธิ์ที่ซับซ้อน

เวลาพูดถึง AI ที่เรียนรู้จากข้อมูลต่างๆ โดยเฉพาะ โค้ดคอมพิวเตอร์ ที่อยู่ภายใต้สัญญาอนุญาตอย่าง GPL (GNU General Public License) ซึ่งมีเงื่อนไขว่า หากคุณนำโค้ดนั้นไปพัฒนาต่อ ผลงานที่ได้ก็ต้องอยู่ภายใต้สัญญาอนุญาต GPL ด้วย ทำให้เกิดคำถามว่าโมเดล AI ที่สร้างขึ้นจากโค้ด GPL ถือเป็น “งานลอกเลียน” หรือ งานต่อยอด (Derivative Work) ที่ต้องปฏิบัติตามเงื่อนไขนี้หรือไม่?

หลายคนเชื่อว่าโมเดล AI ไม่ใช่งานต่อยอดแบบดั้งเดิม เพราะมันไม่ได้ก๊อปปี้โค้ดมาตรงๆ แต่เรียนรู้ความสัมพันธ์ทางสถิติและแพทเทิร์น เมื่อมันสร้างโค้ดใหม่ขึ้นมา โค้ดนั้นจึงไม่ใช่การคัดลอก แต่เป็นการสังเคราะห์ขึ้นมาใหม่จากการเรียนรู้ ปัญหาคือแนวคิดนี้ยังคงเป็นที่ถกเถียงและไม่มีข้อสรุปทางกฎหมายที่ชัดเจน

ตัวการที่แท้จริง: กระบวนการ Tokenization

ลองนึกภาพว่าก่อนที่ AI จะเรียนรู้ข้อมูลได้ ข้อมูลดิบเหล่านั้นจะต้องถูก “สับ” หรือ “แยกส่วน” ออกเป็นหน่วยย่อยๆ ที่เรียกว่า โทเคน (Tokens) เช่น การแยกประโยคเป็นคำ หรือแยกโค้ดเป็นส่วนย่อยๆ กระบวนการนี้เรียกว่า Tokenization ซึ่งจำเป็นอย่างยิ่งในการเตรียมข้อมูลให้ AI เข้าใจ

ปัญหาอยู่ที่นี่เอง ในระหว่างการแยกส่วนข้อมูลนี้ ข้อมูลสำคัญที่ติดมากับโค้ดต้นฉบับ เช่น ข้อมูลเมตา (Metadata) อย่าง ข้อความลิขสิทธิ์ (Copyright Notices) หรือ เงื่อนไขของสัญญาอนุญาต (License Texts) มักจะถูก ตัดทิ้งออกไป ไม่ได้ถูกส่งต่อไปยังโทเคนหรือโมเดล AI

ตามเงื่อนไขของสัญญาอนุญาต GPL มาตรา 3 ระบุไว้อย่างชัดเจนว่า “คุณต้องเก็บรักษาประกาศเกี่ยวกับลิขสิทธิ์และข้อความเกี่ยวกับสัญญาอนุญาตไว้ใน ทุกสำเนา และ งานต่อยอด” เมื่อโค้ดถูกแยกเป็นโทเคน โทเคนเหล่านี้ก็เปรียบเสมือน “สำเนา” ของส่วนต่างๆ ของโค้ดต้นฉบับ แต่กลับขาดข้อมูลสำคัญเกี่ยวกับลิขสิทธิ์และสัญญาอนุญาตไปโดยสิ้นเชิง นี่คือจุดที่เกิดการ ละเมิดเงื่อนไขของ GPL อย่างชัดเจนและตรงไปตรงมา ไม่ใช่ตัวการฝึกฝนโมเดล AI โดยตรง

ทำไมเรื่องนี้ถึงสำคัญ และ AI ต้องปรับตัวอย่างไร

การเข้าใจว่าปัญหาไม่ได้อยู่ที่การฝึกฝน แต่เป็นกระบวนการแยกส่วนข้อมูล ช่วยให้เรามีจุดยืนทางกฎหมายที่แข็งแกร่งขึ้นในการเรียกร้อง แทนที่จะต้องถกเถียงเรื่องงานต่อยอดอันซับซ้อน เราสามารถชี้ไปที่การ ละเมิดเงื่อนไขสัญญาอนุญาต โดยตรงที่เกิดขึ้นระหว่างการประมวลผลข้อมูล

นี่เป็นสัญญาณเตือนที่สำคัญสำหรับนักพัฒนา AI ทุกคน การนำข้อมูลมาใช้โดยไม่คำนึงถึงวิธีการจัดการกับ ข้อมูลเมตา ของสัญญาอนุญาต อาจนำไปสู่ปัญหาทางกฎหมายใหญ่หลวงในอนาคต อุตสาหกรรม AI จำเป็นต้องคิดค้นวิธีการใหม่ๆ ในการจัดการกับข้อมูลการฝึกฝน เพื่อให้แน่ใจว่า ข้อความลิขสิทธิ์ และ เงื่อนไขสัญญาอนุญาต ยังคงอยู่ตลอดกระบวนการ หรืออาจจะต้องพิจารณาใช้ชุดข้อมูลที่ไม่มีข้อจำกัดเช่นนี้ นี่คือความท้าทายใหม่ที่ต้องแก้ไข เพื่อให้ AI พัฒนาไปในทิศทางที่ถูกต้องและเป็นธรรมต่อทุกคน