นักวิจัยแพทย์-วิทย์ มช. ร่วมพัฒนา “CHDS” นวัตกรรมสร้างข้อมูลจำลองอัจฉริยะ ช่วยลดอุปสรรคการพัฒนา AI การแพทย์

25 กันยายน 2569
ศูนย์สื่อสารองค์กรและนักศึกษาเก่าสัมพันธ์

ในยุคปัจจุบันที่เทคโนโลยีปัญญาประดิษฐ์ (AI) และการวิเคราะห์ข้อมูลขนาดใหญ่ (Data Analytics) ได้เข้ามามีบทบาทสำคัญในการขับเคลื่อนสังคมและเศรษฐกิจโลก การพัฒนาโมเดล AI ที่มีความแม่นยำสูงจำเป็นต้องอาศัยชุดข้อมูลจริงจำนวนมหาศาลในการฝึกฝน อย่างไรก็ตาม หนึ่งในอุปสรรคสำคัญที่นักวิจัยและนักพัฒนาทั่วโลกต้องเผชิญมาโดยตลอด คือการไม่สามารถเข้าถึงชุดข้อมูลจริงได้ เนื่องจากข้อจำกัดด้านความเป็นส่วนตัว (Privacy) ความละเอียดอ่อนของข้อมูล หรือปัญหาปริมาณข้อมูลที่ไม่เพียงพอ โดยเฉพาะอย่างยิ่งในงานวิจัยด้านการแพทย์และสาธารณสุข ซึ่งข้อมูลประวัติการรักษาของคนไข้เป็นข้อมูลชั้นลับที่ไม่สามารถเปิดเผยหรือแบ่งปันข้ามองค์กรได้อย่างเสรี

เพื่อแก้ปัญหาที่เป็นคอขวดระดับโลกนี้ ทีมนักวิจัยจากคณะวิทยาศาสตร์และคณะแพทยศาสตร์ มหาวิทยาลัยเชียงใหม่ จึงได้ประสานความร่วมมือข้ามสายงาน ร่วมกันพัฒนาอัลกอริทึมสร้างข้อมูลสังเคราะห์รูปแบบใหม่ขึ้นในชื่อ “CHDS: Geometry-based synthetic data generation for tabular data” ซึ่งเป็นแนวทางการสร้างข้อมูลเทียม (Synthetic Data) สำหรับข้อมูลประเภทตาราง (Tabular Data) โดยนำแนวคิดเชิงเรขาคณิตมาประยุกต์ใช้ ซึ่ง CHDS ถือเป็นทางเลือกใหม่ที่เข้ามาช่วยเพิ่มเทคนิคในการสร้างข้อมูลสังเคราะห์ ช่วยให้สามารถจำลองชุดข้อมูลที่มีคุณลักษณะ รูปร่าง และพฤติกรรมสะท้อนข้อมูลจริงได้อย่างแม่นยำ โดยไม่จำเป็นต้องเปิดเผยข้อมูลส่วนบุคคลหรือเสี่ยงต่อการรั่วไหลของข้อมูลจริง

ความพิเศษและจุดเด่นเชิงนวัตกรรมของอัลกอริทึม CHDS อยู่ที่การข้อจำกัดเดิม ๆ โดยไม่มีการกำหนดสมมติฐานว่าข้อมูลจะต้องมีการแจกแจงรูปแบบใดรูปแบบหนึ่งเป็นการเฉพาะ กระบวนการทำงานใช้เทคนิคขั้นสูง 3 ส่วนหลักร้อยเรียงกัน ได้แก่ การใช้ Convex Hull ในการกำหนดขอบเขตภายนอกของข้อมูล การใช้ การประมาณค่าความหนาแน่น (Density Estimation) เพื่อประมาณการกระจายตัวของข้อมูลภายใน และการใช้กระบวนการสุ่มแบบ MCMC (Markov Chain Monte Carlo-based heuristic) ในการสร้างตัวอย่างข้อมูลชุดใหม่ขึ้นมา ส่งผลให้อัลกอริทึมนี้สามารถรองรับทั้งตัวแปรเชิงตัวเลขและเชิงหมวดหมู่ได้อย่างมีประสิทธิภาพและยืดหยุ่นสูง

จากการทดสอบและประเมินผลเชิงลึกอย่างเข้มงวด โดยเปรียบเทียบกับวิธีสร้างข้อมูลสังเคราะห์ที่ได้รับการยอมรับและใช้งานอย่างแพร่หลายในปัจจุบัน จำนวน 6 วิธี บนชุดข้อมูลมาตรฐานด้าน Machine Learning จำนวน 4 ชุด ผลการศึกษาแสดงให้เห็นว่า CHDS สามารถสร้างข้อมูลสังเคราะห์ที่รักษาคุณลักษณะสำคัญของข้อมูลจริงได้ดีเยี่ยม พร้อมทั้งสร้างสมดุลระดับสมบูรณ์แบบระหว่าง ประโยชน์ในการนำข้อมูลไปใช้งาน (Data Utility) และ การปกป้องความเป็นส่วนตัว (Privacy) ถือเป็นก้าวสำคัญทางวิชาการในการนำเสนอแนวทางใหม่ที่เชื่อมโยงเรขาคณิต ความหนาแน่น และ MCMC เข้าด้วยกัน ซึ่งเป็นทางเลือกใหม่นอกเหนือจากวิธียอดนิยมเดิมอย่าง GAN, VAE หรือ Diffusion-based methods

คุณค่าของงานวิจัยชิ้นนี้ขยายผลครอบคลุมในหลากหลายมิติ ทั้งใน ด้านวิชาการ ที่ช่วยเปิดพรมแดนใหม่ของการสร้างข้อมูลสังเคราะห์ ด้านสังคม ที่ช่วยสนับสนุนการใช้ข้อมูลในงานวิจัยและพัฒนา AI โดยลดความจำเป็นในการแบ่งปันข้อมูลจริงที่มีความละเอียดอ่อน และ ด้านเศรษฐกิจ ที่ช่วยทลายกำแพงการเข้าถึงข้อมูล เร่งความเร็วให้ภาคธุรกิจและอุตสาหกรรมต่าง ๆ สามารถนำข้อมูลไปใช้พัฒนาทดสอบระบบ Machine Learning และ Data Analytics ได้อย่างรวดเร็ว ปลอดภัย และต้นทุนต่ำลง

ผลงานวิจัยนี้ได้รับการตีพิมพ์เผยแพร่ในวารสารวิชาการนานาชาติชั้นนำ Knowledge-Based Systems (Volume 351, Part B, Article 116745) ประจำปี 2026 ซึ่งเกิดจากพลังความร่วมมือของทีมนักวิจัย มช. ได้แก่ นายโสภณัฐ พงษ์มารุทัย (นักศึกษาปริญญาโท สาขาวิทยาการคอมพิวเตอร์), ผศ.ดร.ศุภณัฐ ชัยดี (ภาควิชาคณิตศาสตร์ คณะวิทยาศาสตร์), อ.นพ.ฉันท์ชนก อร่ามรัตน์ และ รศ.ดร.นพ.ชัยสิริ อังกุระวรานนท์ (ภาควิชาเวชศาสตร์ครอบครัว คณะแพทยศาสตร์) โดยมี ผศ.ดร.ปภังกร อิ่นแก้ว (ภาควิชาวิทยาการคอมพิวเตอร์ คณะวิทยาศาสตร์) เป็นอาจารย์ผู้รับผิดชอบบทความวิจัย (Corresponding Author)

สำหรับนักวิจัย นักพัฒนา AI และผู้ที่สนใจ สามารถศึกษาบทความวิจัยฉบับเต็มได้ที่: DOI: https://doi.org/10.1016/j.knosys.2026.116745

แกลลอรี่