说不清条件?直接问一句 →(例:合肥的BMS要几年经验)
要求 Kubernetes 共 1643 条 · 其中近一周 100 条 已筛选: 清除
1. 独立设计海外特定产品能力,安装部署、环境检查、配置引导、升级维护和故障诊断,降低客户的部署与使用门槛。 2. 将客户及相关专业团队确认的要求,转化为数据本地化、权限控制、审计、运维访问和外部安全系统对接等产品能力。 3. 英文界面与文档、本地化配置、用户引导,以及不同地区的使用习惯和运营需求适配。 4. 理解算力、调度、训练、推理、模型服务及商业运营之间的关系,将海外需求转化为清晰的产品要求,与内部各模块负责人共同推进迭代,确保端到端体验与交付的一致性。 5. 独立完成英文产品讲解、技术答疑和 Demo。围绕客户关注点设计演示场景、验证方案与验收标准,准确说明当前能力、适配要求及限制。
岗位职责 1、负责机房、UPS、动环及服务器运维,处理故障、性能优化,落实数据备份与容灾演练,保障基础设施及数据安全稳定运行。 2、支撑多工厂IT问题,组织复盘沉淀经验,对接业务信息化需求,完成需求调研、方案落地到项目验收全流程。 3、完善IT运维制度、流程及安全策略,推进运维标准化、合规化,提升运维效率。 4、负责CAD虚拟机平台运维,解决CAD兼容、版本、性能问题,保障研发设计业务正常使用。 5、开展团队传帮带,培养初级运维人员,完成上级交办的其他信息化工作。 6、完成上级交办的其他信息化相关工作。 任职资格: 1、五年以上制造业网络、服务器和基础设施建设与运维管理经验。…
岗位描述:面向行业头部客户,基于 MaaS 平台能力与大模型应用思维,设计并实施 Agent 架构和 Workflow 工作流,完成从技术方案设计到代码实现的全流程交付,实现多 AI 智能体协同工作,将 MaaS 平台的技术能力转化为实际业务价值。 岗位职责 1. 技术方案与架构设计:深度理解客户业务需求,将其转化为可实现的技术架构与系统设计,负责 AI 应用的整体技术选型,包括 Agent 架构、Workflow、RAG 等。 2. 全流程开发与实现:基于大模型技术,完成从方案设计到代码实现、调试、部署的全流程开发工作。…
Linux Python 中间件 安全与运维 AI / 大模型
岗位职责: 1. 交付与运维: 常驻阿联酋,负责公司AI视频分析产品(软硬件组合)在客户现场的安装部署、系统调试、日常运维及故障排查,保障系统稳定性。 2. 全球技术支持: 配合国内研发团队,为公司其他海外区域的项目提供远程技术支持与问题解决。 3. 客户需求挖掘: 在交付与运维过程中深入理解业务场景,敏锐捕捉客户潜在需求或扩容机会,并及时反馈给售前与产研团队。 任职资格 1. 学历与语言: - 统招本科及以上学历,计算机、通信或相关专业。 - 英语可作为工作语言,具备流利的口语沟通能力及规范的书面表达能力(必须项,需对接海外客户)。…
Python Jenkins CI/CD 安全与运维 消费电子
1、负责服务器资源池建设,以及服务器网络规划及聚合配置; 2、负责虚拟化、监控、发布、存储等系统的部署、维护、调优、扩容等工作; 3、为研发团队提供支持,协助定位问题、故障分析、优化建议等; 4、输出负责系统的相关部署或使用文档; 5、支撑公司各团队的运维需求,保障各业务线的安全、稳定; 6、配合推进系统服务转向k8s技术栈。
应用材料 城市未标注
Java Spring RabbitMQ 后端与架构 芯片 / 半导体
Who We Are Applied Materials is the global leader in materials science and engineering solutions that are at the foundation of virtually every new semiconductor chip and advanced display in the world. The equipment that we create and service is essential to advancing AI and accelerating the commerc…
分布式 Python Kubernetes 算法与AI 芯片 / 半导体
负责规划并推动企业数字员工平台从 Quick Win 走向规模化应用,整合现有 Agent 与 Skill 能力,围绕真实业务场景形成可验证闭环,并逐步建全安全、弹性、可治理的 Agent Infra 和成熟的企业级 SkillHub。 本岗位兼顾架构规划与关键工程落地,需要能够基于业务价值和现有基础制定分阶段实施路线,完成技术选型与边界判断,并亲自推动关键能力落地。 一、岗位职责 •数字员工平台规划与分阶段落地:结合业务目标、现有技术资产和发展阶段,制定从 Quick Win、能力完善到规模化应用的实施路线,明确各阶段目标、优先级、建设边界和交付成果。…
NVIDIA 城市未标注
Python Java Kubernetes 测试与质量 芯片 / 半导体
NVIDIA is looking for a Senior Software Engineer to join the NVIDIA DOCA™ SDK Verification team. The NVIDIA DOCA™ SDK enables developers to rapidly create applications and services on top of NVIDIA® BlueField® data processing units (DPUs), leveraging industry-standard APIs. With DOCA, developers ca…
1)负责超大规模集群在训练、推理、数据传输等核心场景下的高性能网络系统的运维、设计和研发; 2)参与 RDMA、RoCEv2、DPDK 等高性能网络技术的落地与优化,构建极致低延迟、高带宽的通信能力; 3)深入开展大规模训练下的通信性能分析工作,运用先进分析与诊断工具,精准定位并优化性能瓶颈; 4)开发与优化基础网络服务系统,包括但不限于网络地址分配、负载均衡等,同时建设管控平台,实现大模型训练集群网络的自动化管理; 5)支持网络协议分析、性能调优、故障排查等系统级问题解决,提升系统整体稳定性与可观测性; 6)推进高性能网络与平台系统(如训练框架、Kubernetes、RPC 框架)之间的深…
Kubernetes Docker Linux 安全与运维 汽车
1. 负责各产品线服务的稳定、高效运行,跟踪用户体验,优化运维架构; 2. 推动运维自动化/标准化方案设计,自动化工具及平台研发,提升运维效率; 3. 及时响应各类故障报警,快速解决问题恢复业务。
Offboard Infra Engineer 核心职责: · 数据闭环与离线仿真:参与打造业界领先的自动驾驶数据闭环生态系统(Data Flywheel);研发支撑高阶辅助驾驶及端到端大模型应用的大规模云端离线仿真平台等核心基础软件。 · 算法评测与指标体系:设计、构建并持续完善自动驾驶系统的核心评估指标(Metrics)体系与自动化评测平台,助力算法研发的快速闭环与科学度量。 · 云原生与高可用架构:深度参与基于云原生及 Kubernetes 生态的底层架构研发,打造应对海量并发请求、高吞吐、高稳定性的复杂算力调度及业务支撑系统。…
Kubernetes Go Python 算法与AI 芯片 / 半导体
负责AI智算集群平台化及底层核心服务能力建设,负责智算集群架构设计与开发工作; 负责AI智算集群服务的建设,提升AI基础设施服务产品的稳定性与高效性; 负责智算集群领域前沿技术的探索,对训练、推理、仿真等场景的支持; 负责相关开源社区架构和代码贡献与维护。
Linux Docker Kubernetes 安全与运维 通信 / 计算机 / IT
1. 负责公司产品环境的建设与维护,协助处理日常服务器的硬件维护工作; 2. 参与产品架构设计及交付流程设计,制定最佳实践、问题应急预案等方案设计,负责处理常见的问题排查及修复; 3. 负责DevOps流程的维护,实现开发过程自动化,持续提升开发效率和质量;
1.主导 AMR 调度系统核心算法的架构设计与技术选型,包括路径规划、任务分配、交通管制、死锁处理等核心模块; 2. 主导调度算法的性能调优与工程落地,针对高并发、大规模车队(100+ 台)场景持续优化算法效率与系统稳定性; 3. 负责区域锁闭机制、碰撞检测、冲突消解等安全策略的方案设计与核心代码实现; 4. 跟踪学术界与工业界前沿算法(MAPF、强化学习、约束规划等),进行技术预研,推动算法从原型到生产环境的完整落地; 5. 参与调度系统整体架构设计,主导技术方案评审,指导中初级工程师完成模块级开发; 6. 与产品、硬件、嵌入式、算法团队协同,推动跨模块技术方案落地,对算法模块的最终交付质…
NVIDIA 城市未标注
NVIDIA is shaping the next era of computing, where AI, accelerated computing, and high-speed networking come together to power the world’s most advanced AI systems. Within NVIDIA, the Networking Business Unit (NBU) builds the high-speed interconnect technologies — Ethernet, InfiniBand, NVLink, and …
岗位职责: 1.负责AI智算平台核心组件研发(含前后端系统),构建从模型开发到推理部署的一站式解决方案,显著提升AI研发效率; 2.设计高性能计算引擎,优化分布式训练/推理调度策略,有效支撑大模型训练/推理场景; 3.研发全链路监控系统,实现秒级故障检测与自动恢复机制,确保系统高可用性; 4.开发大模型对话平台,涵盖模型调优、智能体构建和知识库管理等核心功能模块; 5.研发故障采集与根因分析系统,快速定位并解决智能加速卡集群运行问题; 6.应用AIOps技术实现运维自动化,持续提升集群稳定性和可靠性。 任职要求: 1、硕士及以上学历,计算机相关专业;…
美光 城市未标注
C# Angular React 算法与AI 芯片 / 半导体
Our vision is to transform how the world uses information to enrich life for all. Micron Technology is a world leader in innovating memory and storage solutions that accelerate the transformation of information into intelligence, inspiring the world to learn, communicate and advance faster than eve…
Kubernetes CI/CD 安全与运维 通信 / 计算机 / IT
Job Summary: We are seeking an experienced Senior Kubernetes & DevOps Engineer to support the administration, performance, and continuous improvement of our cloud-native infrastructure. This role is responsible for managing Kubernetes environments, maintaining DevOps platforms and CI/CD pipelines, …
Go Python Kubernetes 算法与AI AI / 大模型
1、 基于 Kubernetes 建设多租户 GPU 算力调度平台,支持弹性伸缩与任务级管理 2、实现 GPU 拓扑感知调度(NVLink/PCIe),降低跨卡通信 P99 尾延迟 3、 探索 MIG、时间分片等 GPU 切分方案,提升卡级利用率 4、构建高并发大模型在线推理平台 5、 建设 GPU、网络、存储、推理全链路可观测性体系 6、 推进 Spot 实例与自动扩缩容,降低算力成本 7、 建立故障定位、应急响应与根因分析机制
Python Java C++ 后端与架构 AI / 大模型
职位描述: 1、基于 Kubernetes 进行大规模机器学习平台开发,参与资源调度/监控/运行时/网络/存储等服务的设计,开发与维护; 2、面对机器学习平台的性能与效率问题,持续提升资源利用率与系统吞吐; 3、参与开源软件的分析,调研与使用,反哺现有平台。 职位要求: 1、熟练掌握数据结构,算法,计算机组成原理,操作系统和网络等基础知识; 2、良好的开发语言基础,并且至少熟练如下一种研发语言,比如Go/Python/Java/C/C++/Rust 等; 3、充满技术热情,有较强的自驱力和学习能力。 加分项 1、具有 Kubernetes 的使用与开发经验;…
1、生信分析流程开发与交付 参与NGS测序数据的生信分析流程设计与开发,理解从原始数据到分析结果的完整链路,覆盖基因组学、转录组学、单细胞组学、空间组学、表观基因组学、微生物组学、蛋白质组与代谢组等主要组学方向,以及多组学联合分析;参与常规分析流程的开发、测试与交付,确保流程的稳定性、可重复性和可维护性。 2、个性化分析项目攻关 参与科研服务中个性化 / 非常规分析需求的方案设计与技术攻关;独立完成常规复杂度项目的需求理解、技术方案设计、分析执行与结果交付,保证交付质量与验收通过率。 3、生信流程优化与方案设计 参与生信分析流程的优化与重构,提升流程稳定性、交付周期与人效;…
岗位要求: 1.负责系统的日常巡检工作,确保系统稳定性与功能可用性; 2.配合用户完成防火墙策略的下发、防火墙备份解析、攻击源一键封堵及安全作业填报等功能的问题排查; 3.告警工单处理,包括设备磁盘容量、运行情况、业务、数据库及微服务等告警处理; 4.熟悉上报程序部署的服务器位置、路径及启动命令,并完成交接文档的阅读与理解。 5.配合安全部门开展基线、弱口令、渗透扫描及安全加固工作(含方案编写、割接操作、测试验证); 6.4A系统资源与权限管理等业务能力。 任职资格: 1.计算机相关专业本科及以上学历,3年以上软件系统集成项目相关实施、维护工作经验;…
工作职责: 1.辅助制定并执行公司级云管理平台(CMP)与 FinOps(云财务运营)系统的技术发展路线图; 2.作为骨干人员实现从0到1的多云资源纳管、跨云分账与成本优化战略落地。 任职资格: 1.本科及以上学历,计算机科学、软件工程、网络工程等相关专业,8年以上互联网或软件行业技术经验; 2.有成功主导过中大型企业或知名大厂多云场景、混合云治理或大规模云上成本 (FinOps) 优化项目; 3.深度熟悉至少两家主流公有云 (如阿里云、腾讯云、AWS、华为云等) 的 API、计费模型及底层资源 (ECS/EC2、K8s、存储、数据库) ;…
我们正在寻找对视频生成底层技术充满热情的研发工程师,加入我们的核心团队。你将站在“算法落地”与“国产算力”的最前沿,不仅深度参与顶尖开源项目(如商汤Lightx2V)的核心演进,更将直面大规模视频生成服务在国产化环境下的部署挑战,共同打造业界领先的视频生成基础设施。 岗位职责: 1. 核心引擎开发与优化:深度参与商汤Lightx2V等视频生成引擎的核心模块开发,跟踪视频生成的前沿技术趋势,将学术界最新研究成果转化为引擎的实际性能增益。 2. 视频生成工程:打造基于异构算力的高性能视频生成服务,解决大模型推理在国产算力集群上的大规模部署、弹性扩缩容与稳定性难题。…
大模型 Linux Docker 算法与AI 通信 / 计算机 / IT
岗位职责 1. 负责面向内部研发团队的 AI Infra 建设,承担本地大模型推理服务的架构设计、部署、性能优化和稳定运行,为规模化 AI Coding 提供基础支撑。 2. 建设和优化 GPU、Kubernetes、模型推理框架及 AI 网关能力,解决模型接入、资源调度、弹性扩缩、限流配额、可观测性和成本控制等问题。 3. 深入研发流程,将 AI Coding、智能代码审查、自动化测试、问题诊断等能力与现有研发工具链和 DevOps 平台集成。 4. 建设模型服务和研发平台的 CI/CD、自动化测试、发布门禁、灰度及回退能力,提升交付效率和系统质量。…
- 负责工业AI平台核心微服务的Python后端开发与迭代,覆盖多源异构数据接入、流程调度编排、模型推理集成、结果复核与实时上报等关键环节,保障系统在边缘侧的稳定运行。 - 负责工业设备实时通信服务的开发与维护,能够独立排查并解决产线控制、异常告警等高实时性场景下的稳定性问题。 - 负责设备管理平台的接口开发与维护,具备复杂业务场景下的方案落地能力。 - 设计并维护CI自动化构建流程,支持多架构容器镜像的自动构建、制品版本管理与分发。 - 负责所维护服务的容器化部署、日常运维与线上问题排查,能够独立完成从开发到上线的全链路闭环。…
苹果 城市未标注
We're looking for a motivated Software Engineer to join our team and help build and operate reliable, secure, and scalable cloud platforms and services. In this role, you'll develop software and automation that support production systems, Kubernetes platforms, cloud infrastructure, observability, a…
NVIDIA 城市未标注
Python Angular CI/CD 安全与运维 芯片 / 半导体
We are looking for an Automation Engineering Student to join our Infrastructure team, which is responsible for the design and implementation of an elaborate testing automation system, including various elements in different languages and environments, serving hundreds of QA Engineers, running tens …
【课题介绍】 当前大模型 RL 后训练面临多模型(策略/价值/参考/奖励/验证器)并存带来的显存压力、生成回滚与梯度更新的同步等待、海量轨迹数据的传输存储开销等核心痛点;而 AgentRL 场景中,智能体需与十万级并发环境实例进行数十至上百轮交互,长程上下文累积、环境状态异构性与故障频发、推理与训练速度失配等问题进一步加剧系统复杂度。两类场景在分布式通信拓扑优化、经验流数据管道、显存感知调度、容错恢复与资源弹性等层面具有高度一致的系统挑战。本课题将针对上述瓶颈,设计统一的异步流水线架构与动态资源调度器,突破多模型混合训练与大规模环境并行的扩展限制,大幅缩短 RL 迭代周期,显著提升 GPU …
Python 高并发 Docker 研发(未细分) 消费电子
岗位职责 •负责Hermes类智能Agent核心架构设计与开发,搭建Agent自主规划、任务拆 解、迭代执行、自我纠错的完整逻辑链路。 •负责Agent记忆系统研发,设计并实现长短期记忆的存储、智能检索、更新、遗 忘与沉淀机制,解决多轮对话上下文混乱、任务连贯性不足等问题。 •负责Agent工具链编排与集成,实现函数调用、插件管理、多工具串行/并行调 度,对接搜索、代码解释器、文件处理、自动化任务等各类第三方工具。 •落地大模型工程化体系,优化Prompt工程、上下文窗口管理、输出结构化约 束,抑制模型幻觉,提升Agent任务执行准确率与逻辑性。…
分布式 Kubernetes 云原生 后端与架构 AI / 大模型
- 我们正在构建面向下一代大模型的 AI 基础设施。 - 你将深入超大规模 GPU 集群的核心调度链路,解决异构算力管理、复杂工作负载编排、资源效率与系统稳定性等关键问题,为模型训练、推理和持续迭代提供高性能、高弹性、高可用的算力底座。 - 这不是一个以 Kubernetes 运维为主的岗位。我们期待你能够深入调度系统,定义架构、设计机制,并将复杂的基础设施能力沉淀为简单、可靠的工程系统。 职位描述 1. 主导 MiniMax 大模型推理平台与机器学习平台的核心架构设计及演进,构建统一、高效、可扩展的 AI 计算基础设施;…
岗位概述 负责大模型智算集群项目全流程交付落地,主导千卡 / 万卡级 GPU 集群现场实施、联调、问题闭环,对接客户、算力基础设施、算法团队,保障国产加速卡 / N 卡大规模智算集群顺利上线、稳定投产,统筹项目进度、风险与质量,支撑大模型训练 / 推理业务算力底座交付。 岗位职责 负责千卡 / 万卡级别智算 GPU 集群项目整体交付管理,覆盖硬件上架部署、网络组网、集群软件栈部署调优、集群验证、上线交付全流程;支持 NVIDIA 卡、国产加速卡集群交付实施。 统筹项目计划,识别交付风险,协调硬件、网络、固件、驱动、集群调度、客户侧多方资源,推进问题定位闭环,把控项目进度、成本、交付质量,按期…
Docker Kubernetes Linux 后端与架构 芯片 / 半导体
岗位职责: 1. 负责软件开发能效工具开发,AI Agent编排开发; 2. 或,负责 Workload 性能分析与调优工具开发; 3. 或,负责Workload 性能分析与调优。 任职要求: 必备条件(具有一下两类中任意一类): 1. AI Agent 编排相关: - 使用过至少一款 AI 编码/工作助手(Claude Code、Cursor 等),且有可复述的成功提效案例 - 具备任务拆解和并行化思维,能将大型工程任务分解为可独立执行的子任务 - 熟悉提示工程的基本方法论(结构化指令、少样本示例、链式推理等) - 熟悉至少一种 Agent-Tool 交互机制(MCP、Function C…
Docker Kubernetes Linux 研发(未细分) 通信 / 计算机 / IT
工作职责: 1.负责公司业务在主流公有云(AWS、阿里云、Azure 等)上的整体架构设计,确立云原生(Cloud Native)技术路线,保障架构的高可用性与弹性伸缩能力。 2.负责公有云产品的深度调研与技术决策。不局限于厂商宣传,需通过基准测试(Benchmarking)对比不同云厂商在计算(实例规格)、存储(IOPS/吞吐)、网络(带宽/延迟)上的性能差异,给出客观的选型方案。 3.深入研究公有云底层技术原理(如虚拟化技术、计算存储分离架构、云原生网络栈),解决上云后的业务瓶颈及底层技术兼容性问题。 4.负责上云后的性能调优(包括 OS 内核参数、网络优化、存储协议优化等),并建立成本…
大模型 Python Kubernetes 算法与AI 通信 / 计算机 / IT
工作职责 1. 负责大模型服务平台核心功能的开发与建设,包括模型推理部署、模型微调训练、模型蒸馏压缩等关键模块的设计与实现; 2. 持续优化大模型训练推理能力,确保平台在高负载、多机多卡场景下的稳定性和可用性; 3. 集成和维护大模型开发常用工具链,并根据业务需求进行二次开发和功能扩展; 4. 参与平台技术架构的演进规划,推动云原生技术在大模型平台中的应用,提升系统可扩展性和运维效率。 岗位要求 1. 本科及以上学历,计算机、人工智能相关专业,具备2年以上AI基础平台或大模型开发经验; 2. 熟练大模型相关技术栈,包括但不限于vLLM、LLaMA-Factory、Ray等主流工具,具备Pyt…
Docker Kubernetes Python 安全与运维 通信 / 计算机 / IT
职位描述 1. 负责基于k8s云平台的运维工作,推动提升服务的可靠性、可扩展性以及优化成本、性能; 2. 基于业务使用场景,深入优化提供最佳服务治理实践,包含不局限于关键链路性能瓶颈分析、业务问题定位排障、推进系统高可用架构改造升级等; 3.负责linux服务器下各类服务的安装、配置、调优等,各项目容器集群的搭建及各组件的安装部署; 4. 参与AI平台应用服务的持续集成和交付,高效和自动化的运维优化,提升服务的稳定性和研发效率; 5.负责编写各种运维脚本及工具,推动自动化运维; 职位要求 1.本科及以上学历,计算机及相关专业,3年以上相关工作经验;…
苹果 城市未标注
ASE Traffic builds and operates Apple's managed load balancing, service mesh, and gateway offerings for routing and securing traffic across borders, trust zones, and agentic workflows. We're looking for a Solution Architect to be the primary technical partner for engineering teams across Apple who …
NVIDIA 城市未标注
Kubernetes Python 后端与架构 芯片 / 半导体
NVIDIA is hiring experienced software engineers with kubernetes experience to help scale up its AI Infrastructure. We expect you to have significant software engineering experience with kubernetes including cluster operations, operator development, node health monitoring and working with GPU resour…
Python 大模型 Linux 后端与架构 通信 / 计算机 / IT
Key Responsibilities: · Lead technical ownership of customer RFP, RFQ, and responses for AI and HPC GPU cluster opportunities. Design AI cluster solutions based on the latest NVIDIA and AMD GPU hardware platforms. · Analyze customer requirements and develop complete cluster solutions including comp…
一、AI工程师 1、参与企业级 AI Agent 平台基础设施的建设、部署和日常运维,保障平台稳定、安全运行; 2、负责 Red Hat OpenShift/Kubernetes 环境的基础运维,包括应用部署、扩缩容、配置管理、版本升级及故障处理; 3、通过应用日志、容器日志及监控指标,协助定位 AI 应用中的超时、排队、资源不足、网络异常和服务调用失败等问题; 4、参与 Kafka、Redis、PostgreSQL、MinIO、Milvus、Prometheus、Grafana、Loki 等 AI Infra 组件的安装、配置、测试和上线;…
职位描述 1. 参与客户需求沟通,明确项目范围、实施条件、风险及落地路径。 2. 输出 POC 计划、验收标准、实施里程碑、资源评估等售前材料。 3. 推进 POC/试点验证,协同产品、研发及客户 IT 完成技术方案落地。 4. 负责项目实施、进度、质量、成本、风险及验收闭环。 5. 沉淀行业方案、交付模板与最佳实践,推动产品持续迭代。
分布式 Kubernetes Docker 安全与运维 通信 / 计算机 / IT
工作职责: 1.负责UCloud后台大型分布式存储系统的运维和故障处理,根据SOP应对处理从而修复系统中的异常情况; 2.参与生产环境的存储产品运维、软件发布变更、系统性能评估等,实施客户对存储产品的定制化需求; 3.提出合理的建议,对存储产品质量和业务稳定性进行评估,并进行自动化实现的思考,并根据指导落实执行。
岗位职责 1. 平台架构与选型: – 主导数据闭环平台总体架构设计,2026Q4前完成总体架构方案与关键技术选型(湖仓一体、流批一体、任务编排、训练/推理平台),并通过架构评审; – 制定平台3年技术演进路线,平衡自研与开源/商用组合,控制总体拥有成本。 2. 数据标准与数据模型: – 定义跨三域(智能制造、产品研发、研发工程)的统一数据模型与分层规范、数据标准与接口规范,推动多部门数据源对接时标准落地; – 建立架构评审机制,对各域数据接入与链路建设方案做技术把关。 3. 性能、可靠性与成本: – 负责算力/存储资源规划与成本优化,支撑训练与推理规模化后的性能与稳定性目标。…
岗位职责: 1.负责公司产品的现场部署、测试、上线工作; 2.负责现场系统的问题分析、解决方案制定和方案实施工作; 3.工作中能与现场客户、公司后台产品、研发等部门进行有效沟通; 4.服从项目经理安排,能按时按量完成所安排的工作。 任职资格: 1.3年以上软件系统集成项目相关实施、维护工作经验; 2.具有主流数据库(磐维,doris,postgre等)、操作系统(Linux/windows等)、中间件(nginx,haproxy,kafka,tomcat等)的部署、应用经验; 3.具有K8s、docker微服务的部署应用经验; 5.具有Python、Shell脚本编写能力;…
大模型 微服务 Docker 安全与运维 通信 / 计算机 / IT
【岗位职责】 1. 私有化交付与部署: 负责公司AI大模型产品在客户现场或云主机的私有化环境部署、调试与交付工作; 2. 容器化与编排管理: 负责维护和优化微服务的容器化(Docker)部署方案; 3. 自动化工具链维护: 负责维护和优化 standalone-deploy 自动化部署服务,提升私有化交付效率,降低部署成本; 4. 复杂环境适配: 解决不同企业私有化环境中的网络、安全策略、依赖冲突等问题; 5. CI/CD与研发协同: 建立高效的持续集成与持续交付(CI/CD)流水线; 6. 系统监控与故障排查: 负责搭建和完善日志、监控告警体系,快速响应并解决客户生产环境中出现的各类系统及…
1.参与业务解决方案及相关系统需求分析,负责后端服务及中间件模块的设计与开发; 2.负责云端服务模块的架构设计、功能开发、问题定位、Bug修复及性能优化; 3.与产品、前端、测试、运维及客户侧技术团队保持有效沟通,理解并拆解业务需求; 4.编写功能模块详细设计文档、接口文档及相关技术文档; 5.按照团队开发规范与流程,完成系统设计、编码、单元测试、联调测试及上线支持;
Linux Python 数据分析 通信 / 计算机 / IT
岗位职责: 1、面向 AI 行业应用和高性能计算场景,支持用户在使用集群、平台、模型和工具链过程中遇到的技术问题。 2、参与用户应用、训练/推理任务、系统环境和平台组件的调试,协助定位功能、性能和稳定性问题。 3、梳理客户训练、推理和行业应用场景,沉淀 SLA、功能验证、性能测试和使用体验需求。 4、基于 profiling、日志、监控和压测数据,分析应用性能瓶颈,输出评估报告、优化建议和问题复盘。 5、参与高性能计算集群用户环境、应用适配工具、FAQ、workaround 和知识库的建设与维护。
golang研发工程师 【岗位职责】: 1、 我们负责云计算网络虚拟化,包括SDN、NFV在内的虚拟网络核心技术,在这里你将迅速成为骨干和BAT同台竞技; 2、 我们追求极致的可用性,负责数万台节点组成的大规模分布式系统的开发、重构工作;高可用、灰度发布、微服务、Service Mesh是你每天的工作; 3、 我们追求极致的性能,负责网络转发面性能优化,从物理网络到虚拟网络,从 Linux Kernel 到用户空间 DPDK 到支持P4 的可编程交换机,紧密追踪转发面最新技术,并在UCloud 的大规模商用; 4、 我们追求极致的效率,通过流程、工具和系统优化自身的研发效率。
Linux Shell Docker 通信 / 计算机 / IT
1.负责公司自研软件产品的现场部署、环境配置、系统调试及上线交付工作,协助制定实施计划,确保软件按需求稳定运行;针对不同客户的IT环境,完成软件安装、参数配置、数据迁移等全流程实施操作,解决部署过程中的技术难题; 2.负责系统集成项目的实施工作,配合团队完成硬件设备调试、系统联调等任务,确保集成系统整体功能达标;协助进行项目风险排查与问题定位,推动项目按计划顺利验收; 3.负责项目全生命周期各类文档的撰写与整理工作,包括但不限于实施计划、需求调研记录、安装配置手册、测试报告、用户操作手册、项目验收报告等,确保文档的完整性、准确性与规范性,满足项目管理及客户归档需求。
高并发 Linux C++ 机械与电气 通信 / 计算机 / IT
1. 参与面向视频、AI 与物联网场景的嵌入式边缘计算设备的软件架构设计与功能开发,按计划完成交付目标; 2. 编写、维护核心模块代码及相关技术文档,确保代码质量与可维护性; 3. 配合测试团队完成系统和模块级验证,持续优化性能与稳定性; 4. 跟进前沿技术,参与视频流媒体、低延迟等方向的研发与优化。