ทีมนักวิจัยจากคณะวิทยาศาสตร์และคณะแพทยศาสตร์ มหาวิทยาลัยเชียงใหม่ ร่วมกันพัฒนาอัลกอริทึม “CHDS: Geometry-based synthetic data generation for tabular data” แนวทางการสร้างข้อมูลสังเคราะห์สำหรับข้อมูลตารางโดยใช้แนวคิดเชิงเรขาคณิต เพื่อแก้ไขปัญหาข้อจำกัดด้านความเป็นส่วนตัวและการเข้าถึงข้อมูล พร้อมขับเคลื่อนการพัฒนาปัญญาประดิษฐ์ (AI) และ Data Analytics
ในยุคที่เทคโนโลยีปัญญาประดิษฐ์และการวิเคราะห์ข้อมูลเข้ามามีบทบาทสำคัญ การเข้าถึงชุดข้อมูลจริงมักมีข้อจำกัดด้านความเป็นส่วนตัว ความละเอียดอ่อนของข้อมูล หรือมีจำนวนข้อมูลไม่เพียงพอ โดยเฉพาะในงานด้านการแพทย์และสาธารณสุข ทีมนักวิจัยจึงได้พัฒนาขั้นตอนวิธี CHDS ขึ้นมาเป็นทางเลือกใหม่ในการสร้างข้อมูลเทียม (Synthetic Data) ที่สะท้อนลักษณะสำคัญของข้อมูลจริงได้โดยไม่ต้องเปิดเผยข้อมูลส่วนบุคคล
จุดเด่นของวิธี CHDS คือการพัฒนาขั้นตอนวิธีสร้างข้อมูลสังเคราะห์สำหรับข้อมูลตารางโดยใช้แนวคิดเชิงเรขาคณิต โดยไม่กำหนดสมมติฐานว่าข้อมูลต้องมีการแจกแจงรูปแบบใดรูปแบบหนึ่ง วิธีการที่นำเสนอประกอบด้วย การใช้ convex hull เพื่อกำหนดขอบเขตของข้อมูล การใช้การประมาณค่าความหนาแน่น (density estimation) เพื่อประมาณการกระจายของข้อมูล การใช้กระบวนการสุ่มแบบ Markov Chain Monte Carlo (MCMC)-based heuristic เพื่อสร้างตัวอย่างข้อมูลใหม่ รองรับข้อมูลที่มีทั้งตัวแปรเชิงตัวเลขและเชิงหมวดหมู่ได้อย่างมีประสิทธิภาพ
ผลการศึกษาแสดงให้เห็นว่า วิธีการที่นำเสนอสามารถสร้างข้อมูลสังเคราะห์ที่รักษาลักษณะสำคัญของข้อมูลจริงได้ดี และช่วยสร้างความสมดุลระหว่างประโยชน์ของข้อมูล (data utility) และความเป็นส่วนตัว (privacy) ได้อย่างเหมาะสม จากการประเมินเปรียบเทียบกับวิธีสร้างข้อมูลสังเคราะห์ระดับแนวหน้า (State-of-the-Art) จำนวน 6 วิธี บนชุดข้อมูลด้าน Machine Learning จำนวน 4 ชุด
ขั้นตอนวิธีนี้จึงมีประโยชน์อย่างยิ่งในกรณีที่ข้อมูลจริงมีข้อจำกัด เช่น การนำไปใช้พัฒนาและทดสอบโมเดล Machine Learning โดยไม่จำเป็นต้องเผยแพร่หรือเปิดเผยข้อมูลจริงทั้งหมด
ในด้านวิชาการ เป็นการเสนอแนวทางใหม่สำหรับการสร้างข้อมูลสังเคราะห์ที่เชื่อมโยงแนวคิดเชิงเรขาคณิต การประมาณความหนาแน่น และ MCMC เข้าด้วยกัน ถือเป็นทางเลือกที่น่าสนใจนอกเหนือจากวิธีเดิม ๆ เช่น GAN, VAE และ Diffusion-based methods ในด้านสังคม เป็นการสนับสนุนการใช้ข้อมูลในการวิจัยและพัฒนา AI โดยลดความจำเป็นในการแบ่งปันข้อมูลจริงที่มีความละเอียดอ่อน และด้านเศรษฐกิจ ช่วยลดข้อจำกัดในการเข้าถึงข้อมูลสำหรับการพัฒนาและทดสอบระบบ Data Analytics และ Machine Learning ในภาคส่วนต่าง ๆ
งานวิจัยดังกล่าวได้รับการตีพิมพ์ในวารสารวิชาการนานาชาติ Knowledge-Based Systems (Volume 351, Part B, Article 116745) ปี 2026
ผู้สนใจสามารถอ่านบทความวิจัยได้ที่
https://doi.org/10.1016/j.knosys.2026.116745 ทีมวิจัย
นายโสภณัฐ พงษ์มารุทัย นักศึกษาปริญญาโท สาขาวิทยาการคอมพิวเตอร์, ผศ.ดร.ศุภณัฐ ชัยดี ภาควิชาคณิตศาสตร์, อ.นพ.ฉันท์ชนก อร่ามรัตน์ และ รศ.ดร.นพ.ชัยสิริ อังกุระวรานนท์ จากภาควิชาเวชศาสตร์ครอบครัว คณะแพทยศาสตร์ พร้อมด้วย ผศ.ดร.ปภังกร อิ่นแก้ว ภาควิชาวิทยาการคอมพิวเตอร์ คณะวิทยาศาสตร์ (Corresponding Author)