加入我们
岗位描述
预训练数据开采自人类世界全部已有知识所沉积的富矿,是驱动模型强大能力的核心燃料。
预训练数据团队围绕大模型预训练,构建了从数据采集、清洗处理到底层基础设施的完整数据体系,持续为模型训练输送高质量、规模化、多模态的数据燃料,不断拓展模型的世界知识边界。
如何寻找蒙尘的富矿,并淘洗炼制成可用的智能燃料,是一门极难的硬功夫。我们以亿万数据筑就模型智能的坚实底座,更要用普惠的方式,把这份属于全人类的财富,重新还给全人类。
岗位职责
1、根据数据清洗反馈信号设计全网数据选取、调度系统,包括链接质量预估、属性聚合、站点抓取配额、数据优先级等,保证数据多样性,最大化数据覆盖,为模型训练提供丰富的世界知识。
2、面向 RAG 等时效场景,负责时效性种子挖掘、调度与有效性验证,保障关键信息的新鲜度。
3、负责全网数据采集环路的设计与开发,包括但不限于下载、任务调度、流式数据处理、DNS、连通性等核心组件,构建高吞吐、可容错的分布式采集系统。
岗位要求
1、计算机或数学相关专业,本科及以上学历。
2、熟练使用至少一种编程语言,包括但不限于 Python/C++/Rust。
加分项
1、数学或信息学竞赛中取得优秀成绩。
2、有大规模数据采集、爬虫或数据 pipeline 系统研发经验。