01Apodex · May 2026–present
Pretraining Data Infrastructure
Built pretraining data infrastructure from scratch, evolving on-demand fetching into offline batch processing and integrating domain quality assessment with lightweight URL scoring to guide acquisition.
An acquisition pipeline covering raw HTML, PDFs, and other information-rich documents, with quality scoring to guide collection.
PRETRAINING DATA
- raw HTML pages per day, on average
- Several billion
- crawl success rate
- 65% → 90%+




