Ben Gubler Tokka-Bench: Evaluating Tokenizers Across 100 Natural and 20 Programming Languages https://arxiv.org/abs/2610.08794
arxiv cs.CL
@arxiv-cs-cl.bsky.social
Computer Science -- Computation and Language source: export.arxiv.org/rss/cs.CL maintainer: @tmaehara.bsky.social
Houssam Eddine-Othman Lachemat, Shammur Absar Chowdhury Child ASR Adaptation with Adult Retention: An Empirical Study https://arxiv.org/abs/2610.08827
Mo Yu, Yang Liu, Jing Qian When Forgetting Looks Like Improvement: Metric Masking in Streaming Diarizer Adaptation and the Price of Rehearsal https://arxiv.org/abs/2610.08828
Yazhou Zhang, Junhao Yu Emo-Jev: Probabilistic Reasoning for Emotion Classification with Jev https://arxiv.org/abs/2610.08829
Yue Wu, Qinghe Zhang, Yu Zhang, Jian Huang CoDR: Training-Free Confidence-Drift Remasking for Diffusion Language Models https://arxiv.org/abs/2610.08833
Yupei Guo, Jiajun He, Xiaohan Shi, Tomoki Toda, Zekun Yang, Bowen Wang, Yukinobu Taniguchi Leveraging LLM-Generated Explanations for Detecting Emotionally Rewritten Fake News https://arxiv.org/abs/2610.08835
Guang Yang, Homa Hosseinmardi, Fengchen Liu, Amir Ghasemian Beyond the Sycophancy Score: How Task, Model, and Pressure Shape LLM Yielding https://arxiv.org/abs/2610.08840
Tianle Hu, Chen Peng, Yi-Hsin Tsai, Takshing Andy Tung, Bingyang Sun, Yenjou Wang Beyond Risk Prediction: Evidence Grounding and Psychosocial Factor Verification for Explainable Suicide Risk Assessment https://arxiv.org/abs/2610.08842
Yiping Bai QuanLing: Cross-Branch Validation of Language Distance Quantification on Western Romance https://arxiv.org/abs/2610.08851
Thomas Vaitses Fontanari, Maximo Eduardo Rulli, Federico Alvetreti, Donatella Genovese, Simone Scardapane LRCC: Generalizing Low-Rank Compression with Conditional Computation https://arxiv.org/abs/2610.08858
Yiping Bai Tiny-Scale Chinese BERT Pretraining: A Controlled Comparison of MLM, WWM, and MacBERT Strategies https://arxiv.org/abs/2610.08879
Pulak Kuli Steering Follows Geometry, Not Labels: Emotion Directions in a Full-Duplex Speech Model https://arxiv.org/abs/2610.08887
Rui Liu, Tong Zheng, Jindong Gu, Zhipeng Wang CARE: Certifying Acceleration for Vision-Language-Action Inference https://arxiv.org/abs/2610.08917
Pavan Maddula Quad-State Safety Evaluation of Open-Weight Large Language Models on Non-Canonical Inputs https://arxiv.org/abs/2610.09033
Tobias Braun, Nils Loose, Alexander Herzog, Virginia Ceccatelli, Marcus Rohrbach, Thomas Eisenbarth, Lorenzo Cavallaro U-Space: Uncovering When and Why Uncertainty Arises in Language Models https://arxiv.org/abs/2610.09087
Santhosh Kumar Kasa, Siva Rajesh Kasa, Sumit Negi Same Text, Different Prediction: Serving-Context Nondeterminism in Text Classifiers https://arxiv.org/abs/2610.09111
Marek \v{S}uppa, Ivan Vykopal, Andrej Ridzik, Kristi\'an Sopkovi\v{c}, Nat\'alia K\v{n}a\v{z}ekov\'a, Jaroslav Kop\v{c}an, Miroslav Bl\v{s}t\'ak, Vikt\'oria Ondrejov\'a, ... sk-bench: A Native-First Benchmark for Evaluating Large Language Models in Slovak https://arxiv.org/abs/2610.09152
Arkajyoti Chakraborty, Aryan Tayal, Ishika Agarwal, Tanner Sorensen, Justin Chiu, Alessandro Di Bari, Neha Gupta, Andreas Stolcke ToolRACER: A Robust Agentic Conversation Emulation Resource for Agent Training and Evaluation https://arxiv.org/abs/2610.09163
Thushara Manjari Naduvilakandy, Hyeju Jang, Mohammad Al Hasan Multi-Objective Aligned Small Language Model Framework for SUD Patient Dialogue Generation https://arxiv.org/abs/2610.09209
Shunsuke Mitsumori, Tomoya Mizumoto, Yusuke Fujita Dialect-Robust Speech Language Models with Synthetic Pseudo-Dialect Augmentation https://arxiv.org/abs/2610.09321
Wenjun Wang, Heng Li, Yanggan Gu, Hongxia Yang OnlineQAT: On-Policy Distillation for Ultra-Low-Bit Large Language Models https://arxiv.org/abs/2610.09346
Radha Gulhane, Quentin Anthony, Beren Millidge Expert Coupling in MoE Pretraining: Reducing All-to-All Overhead with Correlated Placement and Token Shuffling https://arxiv.org/abs/2610.09372
Jiachen Zhao, Zhengxuan Wu, David Bau, Weiyan Shi The Persona Hierarchy Model: Understanding Contextual Generalization in Fine-Tuning LLMs https://arxiv.org/abs/2610.09384
Yihao Hu, Yanlin Feng, Naoki Otani, Nikita Bhutani ARCS: Towards Precise Text-to-SQL via Structured Disambiguation https://arxiv.org/abs/2610.09396
Benjamin Wilcox, Dawei Gao, Pradeeban Kathiravelu, Douglas Causey, Kewei Sha, Yunhe Feng Arctic Questions, Missing Answers: A Dataset and Benchmark for LLM Abstention in Arctic Science https://arxiv.org/abs/2610.09446
Jiayu Feng Right Number, Wrong State? Measuring Cross-Jurisdiction Substitution in LLM Recall of State Policy https://arxiv.org/abs/2610.09458
Rohit Kumar Sen, Anik Chowdhury BanglaRhet: Benchmarking Classical and Transformer Models for Rhetorical and Persuasion Detection in Bangla Political Speech https://arxiv.org/abs/2610.09464
Yihan Li, Hanyi Zhang, Xiaoxi Jiang, Man Guo Goldsmith: Gold-Loss-Guided Definition Optimization with an Agentic Annotation Harness https://arxiv.org/abs/2610.09489
Nadhem Zmandar, Mo El-Haj, Paul Rayson A Comparative Study of Evaluation Metrics for Long-Document Financial Narrative Summarization with Transformers https://arxiv.org/abs/2610.09529
Shivam Shukla, Jihye Kim, Shubham Gaur, Mahnaz Roshanaei, Magy Seif El-Nasr RELATE: An Evaluation Framework for measuring Relational Orientation of Large Language Models https://arxiv.org/abs/2610.09569