Benjamin Grayzel Cost-Effective Automated Judging of Natural-Language Mathematical Proofs https://arxiv.org/abs/2608.00004
arxiv cs.CL
@arxiv-cs-cl.bsky.social
Computer Science -- Computation and Language source: export.arxiv.org/rss/cs.CL maintainer: @tmaehara.bsky.social
Shuyu Guo, Wenxiang Hu, Yuyue Zhao, Yougang Lyu, Xiaohui Yan RubricReviewer: From Direct Critique to Objective and Comprehensive Rubric-Driven Peer Review https://arxiv.org/abs/2608.00005
Bohan Tang, Yiwen Guo MemoryForge: Synthesize Lifelong Memory for Human-Like LLM Agents https://arxiv.org/abs/2608.00007
Ahmed Cherif AgentMemBench: A Systematic Benchmark for Evaluating Long-Term Memory Management Strategies in Conversational AI Agents https://arxiv.org/abs/2608.00009
Wasim Madha, Nityanand Mathur, Hamees Sayed, Apoorv Singh, Sameer Khurana, Akshat Mandloi, Sudarshan Kamath DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis https://arxiv.org/abs/2608.00011
Fengxiang Wang, Qiuyang Yu, Yueying Li, Mingshuo Chen, Chengchi Fei, Kaiyi Xu, Lixin Gu, Wangxu Wei, Junchao Gong, ... Obshazard-bench: Benchmarking Multimodal Foundation Models for Real-Time Disaster Intelligence from Raw Earth Observation Streams https://arxiv.org/abs/2608.00012
Ziran Li, Qiang Wang, Zhengyu Chen, Shanglin Lei, Borun Chen, Jingang Wang, Xunliang Cai What Transfers from Text to Vision? Capability Scaling Laws and Transfer Dynamics for VLMs https://arxiv.org/abs/2608.00013
Isaac Song, Mohammed Rehan Parwani, Glenn Matlin, Emile Anand, Akhil Theerthala, Arjun Chatterjee, Maria Kostylew, Yonadav G. Shavit, Sebastien Krier, Mark Riedl Role Steering of Language Models for Social Simulations https://arxiv.org/abs/2608.00023
Jingwei Zhang, Haoyu Lei, Zijin Feng, Jiacheng Sun, Farzan Farnia Exploring More to Solve More: Boosting Diversity in Text Diffusion Models via Entropy-Based Guidance https://arxiv.org/abs/2608.00024
Gayathri V Kondapalli, Alexander Ng, Hirsh Pithadia, Rahul Monish, Harvey Yorke, Amir Kayhani SLMs as Multi-Agent Routers: A Progressive SFT and Reinforcement Learning Approach https://arxiv.org/abs/2608.00030
Hongchen Wei, Yuanzhe Wang, Bei Liu, Yifan Yang, Qi Dai, Ruichun Ma, Kai Qiu, Yunsheng Li, Dongdong Chen, Chong Luo, Zhenzhong Chen, Baining Guo XL-DocBench: Benchmarking Evidence-Grounded Extra-Long Document Understanding https://arxiv.org/abs/2608.00036
Ramesh B. Paramkusham Trustworthiness Costs of Domain Adaptation in Small Language Models:A Cross-Architecture Empirical Study https://arxiv.org/abs/2608.00042
Alberto M. G. Saruggia, Sebastien Germano Predicting Startup Exit from Textual Descriptors - A Computational Linguistics Framework https://arxiv.org/abs/2608.00045
Yijie Yin (Department of Physiology, Development and Neuroscience, University of Cambridge, Cambridge, UK, MRC Laboratory of Molecular Biology, Cambridge, UK), ... Neural Circuit Function Inference with LLMs https://arxiv.org/abs/2608.00059
Yan Fang, Jialin Chen, Chun Gan, Hang Yu, Mingjun Nie, Yeyu Zhang, Fengxiang He, Ching Law LLM-OSDA: An Optimal-Stopping Dynamic Auction for Native Advertising in Multi-Turn LLM Conversations https://arxiv.org/abs/2608.00123
DiffusionGemma Team, Adrien Ali Ta\"iga, James Assiene, Daniele Calandriello, Rahma Chaabouni, Jo\~ao Gante, Tamara von Glehn, Nate Keating, Chris Knutsen, Martin Kukla, Tianlin Liu, Ivan Lobov, Ofir Nabati, ... DiffusionGemma Technical Report https://arxiv.org/abs/2608.00146
Lily Zhang A Constitution-Grid Instrument for Data-Efficient RL Alignment (C-Guard) https://arxiv.org/abs/2608.00180
Huajian Zhang, Yiyang Feng, Jiawei Zhou Averaging Bias: Human Faithfulness Annotations are not Locally Faithful https://arxiv.org/abs/2608.00205
Chaimae Abouzahir, Musa Khan, Hala Ali-Hassan, Congbo Ma, Khaled Saleh, Yousra Sadqi, Jihad Mallat, Walid Al-Eisawi, Nizar Habash, Farah E. Shamout Bridging the English-Arabic Medical Knowledge Gap: Targeted Low-Rank Adaptation via Causal Layer Selection https://arxiv.org/abs/2608.00207
Yutong Ke, Ming Yin, Chongwen Zhao, Kaizhu Huang A Few Neurons Reveal When LLMs Misuse Tools: Sparse Detection and Selective Steering for Reliable Tool Use https://arxiv.org/abs/2608.00218
Kejia Zhang, Youran Sun, Chugang Yi, Haizhao Yang Cross-Task Dissociation in Frontier Vision-Language Model Theory of Mind https://arxiv.org/abs/2608.00261
Mario Vega-Barbas, Lidia Mora-Valenciano, Iv\'an Pau, Fernando Seoane, Farhad Abtahi Sixteen models, fewer than two voices: measuring ensemble dispersion where no answer is uniquely correct https://arxiv.org/abs/2608.00285
Nina Vikhrova, Johannes K\"uhling, Sebastian Haunss, Sebastian Pad\'o Comparing and Modeling Argumentation in German Political Communication across Arenas https://arxiv.org/abs/2608.00288
Maryam Haghifam, Jason Cong, Yizhou Sun SeDeM: Selective Decompression of Hidden-State Memories for Long-Context Question Answering https://arxiv.org/abs/2608.00311
Hanwen Xing, Pengyun Wang, BingXu Meng, Kumail Alhamoud, Xiang Li, Jicheng Wang, Xin Yu, Xinyang Han, Xiaomin Li, Philip Torr, Yuexing Hao CurveShift: Is Agent Progress Scalar? Separating Level from Shape https://arxiv.org/abs/2608.00355
Jiang Zhou, Zhiyuan Fan, Xing Wu, Tinghao Yu, Feng Zhang, Lilin Wang Deep Research Pretraining via Predictive Navigation https://arxiv.org/abs/2608.00432
Ziqiang Cui, Han Shi, Bowei He, Yu Pan, Peiyang Liu, Shengyin Sun, Yankai Chen, Haoli Bai, Yichun Yin, Xue Liu, Chen Ma AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction https://arxiv.org/abs/2608.00434
Tao Liu, Tao Feng, Xiangheng Li, Jinwang Song, Yifan Li, Xiaoqing Cheng, Dixuan Zhang, Siquan Li, Lin Lan, Hongying Zan, Kunli Zhang, Chao Wu SERL-SQL: Selective Hindsight Distillation for Text-to-SQL Reinforcement Agentic Learning https://arxiv.org/abs/2608.00485
Igor Buyanov, Darya Yaskova, Danil Serenko, Danil Shkereda, Andrey Yaskov, Ilya Sochenkov The methodology of Constructing the Large-Scale Dataset for Detecting Presuicidal and Anti-Suicidal Signals in Social Media Texts in Russian https://arxiv.org/abs/2608.00497
Sejin Yoo The Learning Objective Governs Perceptual Narrowing: A Cross-Lingual, Layer-Wise, Ten-Seed Study of Self-Supervised Speech Encoders https://arxiv.org/abs/2608.00507