【真格被投】互影科技-创作智能体Agent 工程师 (评测与构建方向)5k-10k
北京学历不限经验不限
互影科技是全球领先的互动内容技术和发行平台,以AI+互动技术赋能全球互动内容创作者,探索下一代数字娱乐的新形态,创造让用户wow的个人化互动内容体验。
【岗位职责】
1、构建评测架构: 设计并开发可扩展的自动化评测框架。支持多模型并行测试、多轮交互轨迹回溯以及结果可视化,打造 Agent 能力的“试金石”。
2、定义创意标准: 参与制定互动内容创作的评测基准 (Benchmark)。将抽象的“剧情质量”转化为可量化的工程指标(如逻辑一致性、角色合规性、分支多样性)。
3、缺陷挖掘与归因: 通过构建对抗性测试用例,主动挖掘 Agent 在长程创作中的典型失败模式(如遗忘、幻觉),并协助算法团队进行误差归因与迭代。
4、全链路场景覆盖: 设计覆盖真实创作任务的测试场景,包括剧情分支管理、多模态内容生成及用户行为模拟,确保 Agent 在复杂场景下的鲁棒性。
【任职要求】
1、工程落地能力: 熟练掌握 Python/JavaScript,具备扎实的脚本开发与自动化工具链搭建经验,能独立完成评测框架的工程化落地。
2、评测分析思维: 具备极强的逻辑思维。能够从复杂的生成内容中抽象出评价维度,设计科学、可复现的实验流程。
3、内容与交互敏感度: 理解叙事逻辑,有游戏剧情生成、交互式内容开发经验者优先。
【我们正在攻克的难题】
1、如何衡量一个 AI 编剧写得好不好?这不仅是主观感受,更是工程挑战。我们需要建立一套“编剧图灵测试”,通过自动化的手段,在复杂的长程交互中精准捕捉 Agent 的逻辑断裂与人设崩塌。
2、如果你对 Agent 评测架构有深入研究,并且渴望用代码构建一套标准,来度量 AI 创意的边界,欢迎加入我们。
【加分项】
1、Code Agent 深度玩家: 熟练使用 Cursor、Claude Dev 等工具,理解 Agent 的多轮协作与工具调用逻辑。
2、开源贡献: 参与过 AIGC 辅助叙事或 Agent Eval 相关开源项目。
3、用户视角: 能从创作者体验出发,提出可落地的优化建议(如剧情可控性、协作编辑支持)。