AI框架研发工程师(J14476)
中科曙光
(满足以下任意一方向): 1. 负责pytorch/TF/JAX及配套生态框架组件在国产GPGPU上的适配、开发与系统级优化; 2. 基于国产GPGPU进行多领域模型(如搜广推、视觉推理、模型训练等)的端到端性能分析及优化; 3. 负责基于国产GPGPU的兼容能力开发及高性能组件(如向量数据库等)研发; 4. 跟踪AI框架及场景的前言进展,依托国产GPGPU进行实际工程落地;
中科曙光
(满足以下任意一方向): 1. 负责pytorch/TF/JAX及配套生态框架组件在国产GPGPU上的适配、开发与系统级优化; 2. 基于国产GPGPU进行多领域模型(如搜广推、视觉推理、模型训练等)的端到端性能分析及优化; 3. 负责基于国产GPGPU的兼容能力开发及高性能组件(如向量数据库等)研发; 4. 跟踪AI框架及场景的前言进展,依托国产GPGPU进行实际工程落地;
中科曙光
(满足以下任意一方向): 1. 负责dense/moe/多模态/强化学习等模型的大规模分布式优化,持续提高大规模分布式场景的算力利用率; 2. 负责大模型训练框架及相关定制通信算子的开发、调试、优化与维护; 3. 负责大规模训练容错库相关开发,优化在超大规模场景下的快速恢复; 4. 负责超大规模集群下的训练性能建模; 5. 跟踪分布式前沿优化技术和社区动态,持续改进产品性能;
中科曙光
1.研发及优化语言大模型及多模态等推理引擎、PD分离推理调度系统; 2.支持新一代自研AI芯片推理引擎开发优化,优化大模型推理性能,打造极致性能优势。
中科曙光
1.研发及优化语言大模型及多模态等推理引擎、PD分离推理调度系统; 2.支持新一代自研AI芯片推理引擎开发优化,手段包括但不限于模型量化、算子优化、通信优化等方式,优化大模型推理性能,打造极致性能优势。
中科曙光
1. 负责大模型推理关键组件的研发、适配与性能优化,包括但不限于 LMCache、Mooncake、Mori等通信库,以及 KV Cache 传输、分层缓存、PD 分离、专家并行通信等相关模块; 2. 面向自研 GPU/AI 芯片,完成推理组件在单机多卡、跨节点及超节点环境下的功能适配、稳定性建设和性能调优,解决计算、通信、内存与调度瓶颈; 3. 建立大模型端到端性能模型,结合模型结构、并行策略、硬件规格和业务负载,对 TTFT、TPOT、吞吐、并发能力、显存占用及扩展效率进行预估; 4. 建立算子性能预估与分析方法,覆盖 GEMM、Attention、MoE、通信及数据搬运等核心算子,分析…
中科曙光
(1)负责服务器备件检验工作,包含备件检验、系统台账管理、工装维护等 (2)协助测试团队完成质量检验相关工作和考核指标; (3)对业务相关工作中发现的问题进行反馈与改进,必要时提出合理化建议; (4)对测试数据进行收集、整理,按照要求进行周、月等进行汇总提交; (5)测试方向偏GPU部件,包含性能测试及故障分析; (6)负责客户RMA管理,供应商返修管理,监控返修周期。
中科曙光
1、负责公司Web、APP、接口全流程测试工作,把控测试质量与项目进度,保障产品稳定上线迭代。 2、参与需求评审,独立制定测试计划、编写测试用例并执行,输出测试报告,完整记录问题及迭代情况。 3、联动产品、研发团队高效沟通,及时暴露风险、跟进问题闭环,推动项目高效推进。 4、持续维护和优化接口测试用例,规范测试流程,提升回归测试效率与覆盖率。 5、负责AI功能、大模型交互、Al接口及智能业务模块专项测试,覆盖功能、准确性、稳定性、边界及并发场景。 6、搭建AI测试环境,设计AI专项测试场景,校验模型输出、数据适配、智能推理效果,排查AI场景各类缺陷问题。…
中科曙光
岗位职责: 1、参与模型、推理框架、硬件平台的 benchmark 设计与回归测试集建设。 2、建设 TTFT、TPOT、吞吐、显存、稳定性等性能指标体系。 3、参与 profiler 数据分析、CI 自动化测试和版本质量门禁建设。 4、跟踪线上/测试问题,维护缺陷分级、根因归档和问题知识库。 5、协助形成模型适配、性能测试和发布准入标准。
中科曙光
岗位职责: 1、参与模型、推理框架、硬件平台的 benchmark 设计与回归测试集建设。 2、建设 TTFT、TPOT、吞吐、显存、稳定性等性能指标体系。 3、参与 profiler 数据分析、CI 自动化测试和版本质量门禁建设。 4、跟踪线上/测试问题,维护缺陷分级、根因归档和问题知识库。 5、协助形成模型适配、性能测试和发布准入标准。
中科曙光
岗位职责: 1、参与模型、推理框架、硬件平台的 benchmark 设计与回归测试集建设。 2、建设 TTFT、TPOT、吞吐、显存、稳定性等性能指标体系。 3、参与 profiler 数据分析、CI 自动化测试和版本质量门禁建设。 4、跟踪线上/测试问题,维护缺陷分级、根因归档和问题知识库。 5、协助形成模型适配、性能测试和发布准入标准。
中科曙光
岗位职责: 1、面向 AI 行业应用和高性能计算场景,支持用户在使用集群、平台、模型和工具链过程中遇到的技术问题。 2、参与用户应用、训练/推理任务、系统环境和平台组件的调试,协助定位功能、性能和稳定性问题。 3、梳理客户训练、推理和行业应用场景,沉淀 SLA、功能验证、性能测试和使用体验需求。 4、基于 profiling、日志、监控和压测数据,分析应用性能瓶颈,输出评估报告、优化建议和问题复盘。 5、参与高性能计算集群用户环境、应用适配工具、FAQ、workaround 和知识库的建设与维护。
中科曙光
岗位职责: 1、面向 AI 行业应用和高性能计算场景,支持用户在使用集群、平台、模型和工具链过程中遇到的技术问题。 2、参与用户应用、训练/推理任务、系统环境和平台组件的调试,协助定位功能、性能和稳定性问题。 3、梳理客户训练、推理和行业应用场景,沉淀 SLA、功能验证、性能测试和使用体验需求。 4、基于 profiling、日志、监控和压测数据,分析应用性能瓶颈,输出评估报告、优化建议和问题复盘。 5、参与高性能计算集群用户环境、应用适配工具、FAQ、workaround 和知识库的建设与维护。
中科曙光
岗位职责: 1、面向 AI 行业应用和高性能计算场景,支持用户在使用集群、平台、模型和工具链过程中遇到的技术问题。 2、参与用户应用、训练/推理任务、系统环境和平台组件的调试,协助定位功能、性能和稳定性问题。 3、梳理客户训练、推理和行业应用场景,沉淀 SLA、功能验证、性能测试和使用体验需求。 4、基于 profiling、日志、监控和压测数据,分析应用性能瓶颈,输出评估报告、优化建议和问题复盘。 5、参与高性能计算集群用户环境、应用适配工具、FAQ、workaround 和知识库的建设与维护。
中科曙光
岗位职责: 1.研发及优化语言大模型及多模态等推理引擎、PD分离推理调度系统; 2.支持新一代自研AI芯片推理引擎开发优化,优化大模型推理性能,打造极致性能优势。
中科曙光
岗位职责: 1.研发及优化语言大模型及多模态等推理引擎、PD分离推理调度系统; 2.支持新一代自研AI芯片推理引擎开发优化,优化大模型推理性能,打造极致性能优势。
中科曙光
岗位职责: 1.研发及优化语言大模型及多模态等推理引擎、PD分离推理调度系统; 2.支持新一代自研AI芯片推理引擎开发优化,优化大模型推理性能,打造极致性能优势。
中科曙光
岗位职责: 1.研发及优化语言大模型及多模态等推理引擎、PD分离推理调度系统; 2.支持新一代自研AI芯片推理引擎开发优化,手段包括但不限于模型量化、算子优化、通信优化等方式,优化大模型推理性能,打造极致性能优势。
中科曙光
岗位职责: 1.研发及优化语言大模型及多模态等推理引擎、PD分离推理调度系统; 2.支持新一代自研AI芯片推理引擎开发优化,手段包括但不限于模型量化、算子优化、通信优化等方式,优化大模型推理性能,打造极致性能优势。
中科曙光
岗位职责: 1.研发及优化语言大模型及多模态等推理引擎、PD分离推理调度系统; 2.支持新一代自研AI芯片推理引擎开发优化,手段包括但不限于模型量化、算子优化、通信优化等方式,优化大模型推理性能,打造极致性能优势。
中科曙光
1、负责人工智能平台及核心中间件的研发,推动AI服务、容器服务、MaaS服务建设,以及模型的工程化落地; 2、参与社区内容建设,主导AI相关资源库(模型库、数据集、智能体应用等)的架构设计; 3、前沿技术落地:持续跟进AI领域最新动态,将最新LLM技术转化为产品功能,持续优化产品性能与客户体验;
中科曙光
1. 负责构建基于大模型的端到端智能体软件架构体系,搭建适用于复杂专业领域的大模型智能体系统; 2. 负责提升AI智能体的综合规划决策能力,自主工具调用能力以及复杂任务处理能力,显著增强智能体在云端和终端场景下的综合应用效能; 3. 负责AI 智能体及其应用产品的设计、搭建与优化工作,设计并实现基于大模型的智能体架构,为 AI 智能体的构建提供坚实的技术支撑; 4. 负责设计并实现多智能体协同架构,有效支持多智能体协同攻克复杂任务; 5. 解决项目执行进程中遭遇的各类技术难题,特别是与新兴AI技术相关的关键挑战。
中科曙光
岗位职责(满足以下任意一方向): 1. 负责pytorch/TF/JAX及配套生态框架组件在国产GPGPU上的适配、开发与系统级优化; 2. 基于国产GPGPU进行多领域模型(如搜广推、视觉推理、模型训练等)的端到端性能分析及优化; 3. 负责基于国产GPGPU的兼容能力开发及高性能组件(如向量数据库等)研发; 4. 跟踪AI框架及场景的前言进展,依托国产GPGPU进行实际工程落地;
中科曙光
岗位职责(满足以下任意一方向): 1. 负责pytorch/TF/JAX及配套生态框架组件在国产GPGPU上的适配、开发与系统级优化; 2. 基于国产GPGPU进行多领域模型(如搜广推、视觉推理、模型训练等)的端到端性能分析及优化; 3. 负责基于国产GPGPU的兼容能力开发及高性能组件(如向量数据库等)研发; 4. 跟踪AI框架及场景的前言进展,依托国产GPGPU进行实际工程落地;
中科曙光
岗位职责(满足以下任意一方向): 1. 负责pytorch/TF/JAX及配套生态框架组件在国产GPGPU上的适配、开发与系统级优化; 2. 基于国产GPGPU进行多领域模型(如搜广推、视觉推理、模型训练等)的端到端性能分析及优化; 3. 负责基于国产GPGPU的兼容能力开发及高性能组件(如向量数据库等)研发; 4. 跟踪AI框架及场景的前言进展,依托国产GPGPU进行实际工程落地;
中科曙光
岗位职责(满足以下任意一方向): 1. 负责dense/moe/多模态/强化学习等模型的大规模分布式优化,持续提高大规模分布式场景的算力利用率; 2. 负责大模型训练框架及相关定制通信算子的开发、调试、优化与维护; 3. 负责大规模训练容错库相关开发,优化在超大规模场景下的快速恢复; 4. 负责超大规模集群下的训练性能建模; 5. 跟踪分布式前沿优化技术和社区动态,持续改进产品性能;
中科曙光
岗位职责(满足以下任意一方向): 1. 负责dense/moe/多模态/强化学习等模型的大规模分布式优化,持续提高大规模分布式场景的算力利用率; 2. 负责大模型训练框架及相关定制通信算子的开发、调试、优化与维护; 3. 负责大规模训练容错库相关开发,优化在超大规模场景下的快速恢复; 4. 负责超大规模集群下的训练性能建模; 5. 跟踪分布式前沿优化技术和社区动态,持续改进产品性能;
中科曙光
岗位职责(满足以下任意一方向): 1. 负责dense/moe/多模态/强化学习等模型的大规模分布式优化,持续提高大规模分布式场景的算力利用率; 2. 负责大模型训练框架及相关定制通信算子的开发、调试、优化与维护; 3. 负责大规模训练容错库相关开发,优化在超大规模场景下的快速恢复; 4. 负责超大规模集群下的训练性能建模; 5. 跟踪分布式前沿优化技术和社区动态,持续改进产品性能;
中科曙光
岗位职责: 1.用户拓展与渠道触达:负责海光DCU在基础大模型领域的用户拓展,围绕智谱、DeepSeek、科大讯飞等头部厂商及生态伙伴,通过行业会议、开发者活动、技术社区、伙伴转介绍等渠道触达潜在用户,建立并持续维护客户关系,不断扩大海光算力的用户覆盖面。 2.需求挖掘与商机推进:深入了解客户大模型训练/推理业务与算力痛点,挖掘适配需求与潜在商机;完成需求收集,输出结构化需求清单,推动线索从接触到落地转化。 3.软硬件协同适配支撑:承接客户模型与主流框架(PyTorch、DeepSpeed、Megatron-LM、vLLM 等)在海光DCU软硬件栈上的迁移适配需求,负责问题跟踪与推动协同攻关…
中科曙光
1. 解读政企、行业客户招标文件,识别实质性条款、评分点与废标风险 2. 制定投标分工计划与进度表,推动技术、商务、报价、资质模块按时交付 3. 牵头编制/整合投标书(服务方案、商务响应、报价策略、资质证明) 4. 组织标前评审、合规检查、决策申请、澄清答疑、交标与开标跟进 5. 管理投标资质库(营业执照、财报、认证、业绩案例),维护电子招投标系统 6. 标后复盘、风险闭环、中标/未中标分析,支撑销售与售前优化策略 7. 商务相关工作
中科曙光
工作职责 岗位职责: 1、参与 vLLM、SGLang、Transformers 等主流推理框架的版本升级、插件适配和镜像交付。 2、支持模型上线、部署调参、压测验证和问题定位。 3、分析 TTFT、TPOT、吞吐、显存占用和稳定性等推理性能瓶颈。 4、参与 KV Cache、batching、并发调度、模型加载等关键链路优化。 5、沉淀模型部署最佳实践、适配文档和问题解决方案 任职资格