โ Home- KSE-Web: An Analysis of Hybrid Retrieval and LLM-Assisted Query Expansion for Low-Resource Khmer Semantic SearcharXiv:2608.21365 ยท 07-Sep-2026
- Bridging the Gap: Dynamic Learning Strategies for Improving Multilingual Performance in LLMsarXiv:2405.18359 ยท 04-Sep-2026
- One Form to Transfer Them All: Pretraining Multilingual Language Models Beyond Native OrthographyarXiv:2608.25904 ยท 03-Sep-2026
- LLM Safety Alignment in Low-Resource Languages: A Systematic Literature ReviewarXiv:2608.14626 ยท 26-Aug-2026
- Trans-Tokenization and Cross-lingual Vocabulary Transfers: Language Adaptation of LLMs for Low-Resource NLParXiv:2408.04303 ยท 25-Aug-2026
- TokAlign: Efficient Vocabulary Adaptation via Token AlignmentarXiv:2506.03523 ยท 24-Aug-2026
- Camellia : Benchmarking Cultural Biases in LLMs for Asian LanguagesarXiv:2510.05291 ยท 21-Aug-2026
- The Tokenizer Tax: Quantifying and Explaining the Cross-Lingual Cost of Subword Tokenization for Indian LanguagesarXiv:2607.24276 ยท 20-Aug-2026
- Can Large Language Models Handle Discourse Particles?arXiv:2605.28782 ยท 19-Aug-2026
- Quantifying Language Disparities in Multilingual Large Language ModelsarXiv:2508.17162 ยท 18-Aug-2026
- Utilizing Multilingual Encoders to Improve Large Language Models for Low-Resource LanguagesarXiv:2508.09091 ยท 17-Aug-2026
- Anthropogenic Regional Adaptation in Multimodal Vision-Language ModelarXiv:2604.11490 ยท 14-Aug-2026
- Mechanistic Understanding and Mitigation of Language ConfusionarXiv:2505.16538 ยท 13-Aug-2026
- An Interdisciplinary Approach to Human-Centered Machine TranslationarXiv:2506.13468 ยท 11-Aug-2026
- Multilinguality of Large Language Models From a Structural PerspectivearXiv:2606.01800 ยท 10-Aug-2026
- Beyond Sequence Order: Syntax-Informed Positional Embeddings for TransformersarXiv:2608.06111 ยท 07-Aug-2026
- Phoenix: Democratizing ChatGPT across LanguagesarXiv:2304.10453 ยท 04-Aug-2026
- Large Vocabulary Size Improves Large Language ModelsarXiv:2406.16508 ยท 29-Jul-2026
- Biomedical Machine Translation for Low-Resource Arabic-ScriptarXiv:2607.22300 ยท 28-Jul-2026
- grapheme-kit: Grapheme-Level Metrics and Text Processing for Multilingual NLParXiv:2607.22456 ยท 27-Jul-2026
- SEATauBench: Adapting Tool-Agent-User Evaluation Into Low-Resource Southeast Asian LanguagesarXiv:2606.28715 ยท 24-Jul-2026
- A Rigorous Evaluation of LLM Data Generation Strategies for Low-Resource LanguagesarXiv:2506.12158 ยท 22-Jul-2026
- Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic ContentarXiv:2607.16117 ยท 20-Jul-2026
- MMLU-ProX: A Multilingual Benchmark for Advanced Large Language Model EvaluationarXiv:2503.10497 ยท 15-Jul-2026
- Test-Time Scaling for Small VLMs on Multilingual Visual MCQarXiv:2607.09438 ยท 14-Jul-2026
- Rethinking Indic AI from a Lens of Cultural Heritage PreservationarXiv:2607.06544 ยท 09-Jul-2026
- Aligning Large Language Models to Low-Resource Languages through LLM-Based Selective Translation: A Systematic StudyarXiv:2507.14304 ยท 08-Jul-2026
- SEA-HELM: Southeast Asian Holistic Evaluation of Language Models07-Jul-2026
- Languages are Modalities: Cross-Lingual Alignment via Encoder InjectionarXiv:2510.27254 ยท 03-Jul-2026
- LLM Parameters for Math Across Languages: Shared or Separate?arXiv:2606.18453 ยท 02-Jul-2026
- Indic-TunedLens: Interpreting Multilingual Models in Indian LanguagesarXiv:2602.15038 ยท 01-Jul-2026
- Encode Errors: Representational Retrieval of In-Context Demonstrations for Multilingual Grammatical Error CorrectionarXiv:2606.15416 ยท 30-Jun-2026
- SEA-Embedding: Open and Reproducible Text Embeddings for Southeast AsiaarXiv:2606.03027 ยท 29-Jun-2026
- Cross-Lingual Sentiment Misalignment: Auditing Multilingual Language Models for Inversion Risk, Dialectal Representation, and Affective StabilityarXiv:2602.17469 ยท 25-Jun-2026
- Want Better Synthetic Data? Steer It: Activation Steering for Low-Resource Language GenerationarXiv:2606.18389 ยท 22-Jun-2026
- Are Large Language Models for Education Reliable for All Languages?arXiv:2504.17720 ยท 22-Jun-2026
- Not All Languages are Equal: Insights into Multilingual Retrieval-Augmented GenerationarXiv:2410.21970 ยท 19-Jun-2026
- The Shibboleth Effect: Auditing the Cross-Lingual Distributional Skew of Large Language ModelsarXiv:2606.11082 ยท 18-Jun-2026
- MMTEB: Massive Multilingual Text Embedding BenchmarkarXiv:2502.13595 ยท 17-Jun-2026
- Equity with Efficiency: An Empirical Study of Tokenizers for Multilingual Large Language ModelsarXiv:2606.15044 ยท 16-Jun-2026
- Mitigating Translationese Bias in Multilingual LLM-as-a-Judge via Disentangled Information BottleneckarXiv:2603.10351 ยท 15-Jun-2026
- Marco-LLM: Bridging Languages via Massive Multilingual Training for Cross-Lingual EnhancementarXiv:2412.04003 ยท 15-Jun-2026
- MultiHaluDet: Multilingual Hallucination Detection via LLM Hidden State ProbingarXiv:2605.24919 ยท 11-Jun-2026
- Your UnEmbedding Matrix is Secretly a Feature Lens for Text EmbeddingsarXiv:2606.07502 ยท 09-Jun-2026
- Myanmar XNLI: Building a Dataset and Exploring Low-resource Approaches to Natural Language Inference with MyanmararXiv:2504.09645 ยท 08-Jun-2026
- The State of Multilingual LLM Safety Research: From Measuring the Language Gap to Mitigating ItarXiv:2505.24119 ยท 08-Jun-2026
- Multilingual Knowledge Transfer under Data Constraints via Lexical InterventionsarXiv:2605.23885 ยท 26-May-2026
- Unraveling the Token Dynamics of Large Language Models for Machine TranslationarXiv:2605.07533 ยท 25-May-2026
- Reinforcement Learning with Semantic Rewards Enables Low-Resource Language Expansion without Alignment TaxarXiv:2605.14366 ยท 21-May-2026
- Multilingual != Multicultural: Evaluating Gaps Between Multilingual Capabilities and Cultural Alignment in LLMsarXiv:2502.16534 ยท 20-May-2026
- Assessing Thai Dialect Performance in LLMs with Automatic Benchmarks and Human EvaluationarXiv:2504.05898 ยท 19-May-2026
- Babel: Open Multilingual Large Language Models Serving Over 90% of Global SpeakersarXiv:2503.00865 ยท 15-May-2026
- Language Ranker: A Metric for Quantifying LLM Performance Across High and Low-Resource LanguagesarXiv:2404.11553 ยท 13-May-2026
- Adapting Multilingual LLMs to Low-Resource Languages using Continued Pre-training and Synthetic CorpusarXiv:2410.14815 ยท 12-May-2026
- The Roots of Performance Disparity in Multilingual Language Models: Intrinsic Modeling Difficulty or Design Choices?arXiv:2601.07220 ยท 11-May-2026
- Representing the Under-Represented: Cultural and Core Capability Benchmarks for Developing Thai Large Language ModelsarXiv:2410.04795 ยท 08-May-2026
- Neither Here Nor There: Cross-Lingual Representation Dynamics of Code-Mixed Text in Multilingual EncodersarXiv:2603.19771 ยท 07-May-2026
- All Languages Matter: Understanding and Mitigating Language Bias in Multilingual RAGarXiv:2604.20199 ยท 06-May-2026
- On the limited utility of parallel data for learning shared multilingual representationsarXiv:2603.29026 ยท 05-May-2026
- Multilingual Language ModelsarXiv:2604.05090 ยท 05-May-2026
- Deep Language Geometry: Constructing a Metric Space from LLM WeightsarXiv:2508.11676 ยท 04-May-2026
- Sailor2: Sailing in South-East Asia with Inclusive Multilingual LLMsarXiv:2502.12982 ยท 01-May-2026
- Mind the Language Gap: Automated and Augmented Evaluation of Bias in LLMs for High- and Low-Resource LanguagesarXiv:2504.18560 ยท 29-Apr-2026
- Robust Bias Evaluation with FilBBQ: A Filipino Bias Benchmark for Question-Answering Language ModelsarXiv:2602.14466 ยท 28-Apr-2026
- Compass-v3: Scaling Domain-Specific LLMs for Multilingual E-Commerce in Southeast AsiaarXiv:2509.09121 ยท 24-Apr-2026
- SeaLLMs - Large Language Models for Southeast AsiaarXiv:2312.00738 ยท 21-Apr-2026
- Multilingual Large Language Models do not comprehend all natural languages to equal degreesarXiv:2602.20065 ยท 20-Apr-2026
- XQ-MEval: A Dataset with Cross-lingual Parallel Quality for Benchmarking Translation MetricsarXiv:2604.14934 ยท 19-Apr-2026
- Benchmarking Linguistic Adaptation in Comparable-Sized LLMs: A Study of Llama-3.1-8B, Mistral-7B-v0.1, and Qwen3-8B on Romanized NepaliarXiv:2604.14171 ยท 19-Apr-2026
- The Token Tax: Systematic Bias in Multilingual TokenizationarXiv:2509.05486 ยท 19-Apr-2026
- VietJobs: A Vietnamese Job Advertisement DatasetarXiv:2603.05262 ยท 17-Apr-2026
- Benchmarking Concept-Spilling Across Languages in LLMsarXiv:2601.12549 ยท 17-Apr-2026
- Rice-VL: Evaluating Vision-Language Models for Cultural Understanding Across ASEAN CountriesarXiv:2512.01419 ยท 17-Apr-2026
- Typologically-Informed Candidate Reranking for LLM-based Translation into Low-Resource LanguagesarXiv:2602.01162 ยท 17-Apr-2026
- Mangosteen: An Open Thai Corpus for Language Model PretrainingarXiv:2507.14664 ยท 17-Apr-2026
- The Serendipity of Claude AI: Case of the 13 Low-Resource National Languages of MaliarXiv:2503.03380 ยท 17-Apr-2026
- Language on Demand, Knowledge at Core: Composing LLMs with Encoder-Decoder Translation Models for Extensible MultilingualityarXiv:2603.17512 ยท 17-Apr-2026
- Tokenization and Representation Biases in Multilingual Models on Dialectal NLP TasksarXiv:2509.20045 ยท 17-Apr-2026
- Cross-Lingual Activation Steering for Multilingual Language ModelsarXiv:2601.16390 ยท 17-Apr-2026
- SEALGuard: Safeguarding the Multilingual Conversations in Southeast Asian Languages for LLM Software SystemsarXiv:2507.08898 ยท 17-Apr-2026
- SeaLLMs 3: Open Foundation and Chat Multilingual Large LanguagearXiv:2407.19672 ยท 17-Apr-2026
- When Meaning Isn't Literal: Exploring Idiomatic Meaning Across Languages and ModalitiesarXiv:2604.10787 ยท 17-Apr-2026
- SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast AsiaarXiv:2502.06298 ยท 17-Apr-2026
- LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM SafetyarXiv:2604.12710 ยท 17-Apr-2026
- SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast AsiaarXiv:2410.12462 ยท 17-Apr-2026
- BBPE16: UTF-16-based byte-level byte-pair encoding for improved multilingual speech recognitionarXiv:2602.01717 ยท 17-Apr-2026
- ShifCon: Enhancing Non-Dominant Language Capabilities with a Shift-based Multilingual Contrastive FrameworkarXiv:2410.19453 ยท 17-Apr-2026
- Debiasing Large Language Models in Thai Political Stance Detection via Counterfactual CalibrationarXiv:2509.21946 ยท 17-Apr-2026
- Unlocking Multilingual Reasoning Capability of LLMs and LVLMs through Representation EngineeringarXiv:2511.23231 ยท 17-Apr-2026
- SEA-SafeguardBench: Evaluating AI Safety in SEA Languages and CulturesarXiv:2512.05501 ยท 17-Apr-2026
- mSTEB: Massively Multilingual Evaluation of LLMs on Speech and Text TasksarXiv:2506.08400 ยท 17-Apr-2026
- Rethinking what Matters: Effective and Robust Multilingual Realignment for Low-Resource LanguagesarXiv:2511.06497 ยท 17-Apr-2026
- Opportunities and Challenges of Large Language Models for Low-Resource Languages in Humanities ResearcharXiv:2412.04497 ยท 17-Apr-2026
- Large Multimodal Models for Low-Resource Languages: A SurveyarXiv:2502.05568 ยท 17-Apr-2026
- Mining Large Language Models for Low-Resource Language Data: Comparing Elicitation Strategies for Hausa and FongbearXiv:2604.12477 ยท 17-Apr-2026
- Tokenization Disparities as Infrastructure Bias: How Subword Systems Create Inequities in LLM Access and EfficiencyarXiv:2510.12389 ยท 17-Apr-2026
- OpenSeal: Good, Fast, and Cheap Construction of an Open-Source Southeast Asian LLM via Parallel DataarXiv:2602.02266 ยท 17-Apr-2026
- The Hidden Space of Safety: Understanding Preference-Tuned LLMs in Multilingual contextarXiv:2504.02708 ยท 17-Apr-2026
- Enhancing Multilingual RAG Systems with Debiased LanguagearXiv:2601.02956 ยท 17-Apr-2026
- The Geometry of Multilingual Language Models: An Equality LensarXiv:2305.07839 ยท 17-Apr-2026
- Learning Speech Representations with Variational Predictive CodingarXiv:2601.00100 ยท 17-Apr-2026
- LaoBench: A Large-Scale Multidimensional Lao BenchmarkarXiv:2511.11334 ยท 17-Apr-2026
- BHASA: A Holistic Southeast Asian Linguistic and Cultural Evaluation Suite for Large Language ModelsarXiv:2309.06085 ยท 17-Apr-2026
- Bridging Linguistic Gaps: Cross-Lingual Mapping in Pre-Training and Dataset for Enhanced Multilingual LLM PerformancearXiv:2604.10590 ยท 17-Apr-2026
- Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource LanguagesarXiv:2509.14804 ยท 17-Apr-2026
- Multilingual Text RepresentationarXiv:2309.00949 ยท 17-Apr-2026
- SeaLLMs-Audio: Large Audio-Language Models for Southeast AsiaarXiv:2511.01670 ยท 16-Apr-2026
- MERIT: Multilingual Expert-Reward Informed Tuning for Chinese-Centric Low-Resource Machine TranslationarXiv:2604.04839 ยท 16-Apr-2026
- SailCompass: Towards Reproducible and Robust Evaluation for Southeast Asian LanguagesarXiv:2412.01186 ยท 16-Apr-2026
- BURMESE-SAN: Burmese NLP Benchmark for Evaluating Large Language ModelsarXiv:2602.18788 ยท 16-Apr-2026
- Toward Robust Multilingual Adaptation of LLMs for Low-Resource LanguagesarXiv:2510.14466 ยท 16-Apr-2026
- Mind the Gap: Pitfalls of LLM Alignment with Asian Public OpinionarXiv:2603.06264 ยท 16-Apr-2026
- English is Not All You Need: Systematically Exploring the Role of Multilinguality in LLM Post-TrainingarXiv:2604.13286 ยท 16-Apr-2026
- FILBENCH: Can LLMs Understand and Generate Filipino?arXiv:2508.03523 ยท 16-Apr-2026
- Bhaasha, Bhasa, Zaban: A Survey for Low-Resourced Languages in South Asia -- Current Stage and ChallengesarXiv:2509.11570 ยท 16-Apr-2026
- SEA-HELM: Southeast Asian Holistic Evaluation of Language ModelsarXiv:2502.14301 ยท 15-Apr-2026
- ProverbEval: Exploring LLM Evaluation Challenges for Low-resource LanguagesarXiv:2411.05049 ยท 15-Apr-2026
- SEA-LION: Southeast Asian Languages in One NetworkarXiv:2504.05747 ยท 15-Apr-2026
- Is Small Language Model the Silver Bullet to Low-Resource Languages Machine Translation?arXiv:2503.24102 ยท 15-Apr-2026
- Global MMLU: Understanding and Addressing Cultural and Linguistic Biases in Multilingual EvaluationarXiv:2412.03304 ยท 15-Apr-2026
- SEA-BED: How Do Embedding Models Represent Southeast Asian Languages?arXiv:2508.12243 ยท 15-Apr-2026
- Which Humans?arXiv:2506.14680 ยท 15-Apr-2026
- SEACrowd: A Multilingual Multimodal Data Hub and Benchmark Suite for Southeast Asian LanguagesarXiv:2406.10118 ยท 15-Apr-2026