01Apodex · May 2026–present
Pretraining Data Infrastructure
Built pretraining data infrastructure from scratch, evolving on-demand fetching into offline batch processing and integrating domain quality assessment with lightweight URL scoring to guide acquisition.
An acquisition pipeline covering raw HTML, PDFs, and other information-rich documents, with quality scoring to guide collection.
