ข้ามไปเนื้อหา

การสูญเสียประสิทธิภาพของภาษาไทยในการทำ Tokenization ของโมเดลภาษาขนาดใหญ่

Tokenization Efficiency in Thai Language Processing: A Script-Aware Pre-Tokenization Solution

Ma Long, Nara Lab Research Team | Technical Report · 2026