When Tokenizers Fail: Byte-Level Chunking for Zero-Shot Transfer to Low-Resource Languages Paper • 2608.27658 • Published 22 days ago
How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data Paper • 2604.13977 • Published Apr 15 • 2
MultiHashFormer: Hash-based Generative Language Models Paper • 2606.28057 • Published Jun 26 • 23
On the Utility and Factual Reliability of Pruned Mixture-of-Experts Models in the Biomedical Domain Paper • 2607.01444 • Published Jul 1 • 2
MultiHashFormer: Hash-based Generative Language Models Paper • 2606.28057 • Published Jun 26 • 23