AI Agent测试开发工程师
全职
热招
北京
岗位职责
- 负责 AI Agent 端到端任务质量的评测体系建设:设计任务级评测集,制定指标体系与评分标准,让任务成功率成为可度量、可回归、可持续提升的工程指标,并定期输出质量报告与优化建议;
- 基于可观测性体系(执行轨迹、决策日志、评测数据)分析线上 badcase,完成问题复现、根因定位与归因分类(客户端缺陷 / 策略缺陷 / 外部环境变化 / 机型差异),并负责缺陷的分级、跟踪与闭环;
- 负责策略与模型改动的质量准入:prompt、判定阈值、流程配置或模型版本变更后组织回归验证,输出改动前后的对比数据与上线结论;
- 负责 Android 客户端版本质量把关:参与需求评审与风险识别,完成测试方案与用例设计,覆盖功能、接口、数据一致性及异常与中断场景;负责版本回归、发版前质量评估、发版后验证及应用市场上架合规验证;
- 负责性能、稳定性与厂商 ROM 兼容性测试:ANR 与主线程卡顿、内存、耗电、长任务执行耗时,建立性能基线并跟踪版本间劣化;建设并维护机型覆盖矩阵,持续梳理各 ROM 在权限模型、后台策略、悬浮窗、无障碍服务等方面的差异与影响;
- 负责自动化执行与评测平台的建设与扩展:使用 Python 完成多设备批量执行、结果回收、数据比对与统计,推动重复回归任务的自动化执行、定时调度与结果告警;
- 负责测试与标注人力的组织管理:制定标注规范与判定口径,组织兼职、外包或运营人力完成标注与回归执行,负责培训、排期、抽检、验收及分歧裁决;沉淀测试点、评测集、缺陷案例与脚本等测试资产,推动流程标准化与提效。
任职要求
- 具备扎实的 Android 真机测试能力:熟练使用 adb 完成安装部署、日志抓取、崩溃堆栈与 ANR 分析及多设备管理,能通过投屏、群控或脚本高效管理多台测试设备;
- 具备厂商 ROM 兼容性测试的实战经验,了解主流国产 ROM 在权限管理、后台策略、悬浮窗、无障碍服务等方面的实际差异;
- 具备较强的问题分层归因能力:面对偶发、跨系统、依赖外部环境的失败场景,能够通过控制变量逐步缩小范围并给出明确结论;
- 掌握 Python,能够独立编写与调试自动化脚本,完成批量执行、日志处理、数据统计与结果比对;
- 具备完整的软件测试基础:需求分析、测试设计、功能与异常验证、缺陷跟踪、回归测试与发版质量评估;
- 具备测试执行与标注人力的组织管理能力,能够制定标准、拆解任务、排期跟进、抽检验收,并对最终交付质量负责;
- 具备良好的文档与表达能力,能够将分散现象整理为结构化结论(如按机型 × 问题维度归类),清晰说明问题背景、复现路径、影响范围与风险等级;
- 熟练使用 Cursor、Claude Code、Codex 等 Vibe Coding 工具,借助 AI 高效编写脚本、分析数据与迭代;
- 能够适应高重复度的测试工作:核心工作为在多台设备上反复执行分钟级长流程任务,并分析大量执行记录。
加分项
- 有 RPA、GUI Agent / Computer-Use、真机群控或 UI 自动化(Appium / UIAutomator / 无障碍自动化)相关经验;
- 有 AI 或大模型产品评测经验:评测集设计、指标体系建设、人工评分体系或模型版本回归;
- 有长链路交易类业务(电商、本地生活等)的测试经验,熟悉下单链路与价格、优惠等业务口径;
- 具备数据分析能力(SQL、pandas 等),能够独立完成数据处理与规律挖掘;
- 有应用市场上架与审核合规经验(华为、小米、OPPO、vivo、应用宝等);
- 有测试团队或标注团队从零组建、测试流程建设或团队提效经验。
其他
- 工作地点北京;提供员工宿舍;早期创业团队,扁平管理;表现优异者提供期权激励。