2023 年起主导 AI 浏览器 / Agent 化体验从 0→1 落地:把 Edge Copilot 从 0 做到百万级 DAU; 用 LLM 重构 Tabs 等核心功能,带动千万级业务盘子 3× 增长。
| 2023 | Tabs Auto Grouping 全球首发(领先 Google 12 个月)· 侧边栏长文总结(contextual RAG) |
| 2024 | Browse-for-me 原型(首次串起检索 / 阅读 / 执行)· Tabs / Favorites / History 自动内容治理 · ICONIP 2024 |
| 2025 | Contextual Chat 端到端重构(Text / Vision / CUA 统一进 React Loop;SSR 76%→90%,Action 50%→90%,延迟 10s→1s)· ICASSP 2026 一作(WebRouter) |
| 2026 | Lead Intent / Journeys / Blueprints 三主线 · Journeys 全球首发(业界首个把长期浏览意图图文化为任务卡)· AAAI 2027 在投一作(Skill Crediting) |
把一份 LLM Agent skill 编译成 unit 图,用双算子(content value / context cost)给每个 unit 打二维分,产出"保留 / 压缩 / 删除"决策表——第一个把 skill evaluation 从"整包一个数"下沉到 unit 粒度的框架,驱动 skill 库自动裁剪、加权与再训练。
基于变分信息瓶颈(VIB)对 query 编码做信息压缩,在保证任务效果的前提下显著降低单 query 平均推理成本;落地 Edge Copilot 线上意图路由。
多模态推理混合架构,提升 VQA 任务的可解释性与准确率。
为 MSR Fara1.5 (4B/9B/27B) CUA 模型贡献 38,384 对多语言任务(德 / 西 / 法 / 葡 / 意 / 日 / 中 7 语)。Fara1.5-27B 在 Online-Mind2Web 上达 72% 成功率,超过 Gemini 2.5 Computer Use、OpenAI Operator、Yutori Navigator n1。
从不同的视角看我的职业生涯。
| 时间 | 论文 / 专利 | 研究问题 |
|---|---|---|
| 2023 | 首个 LLM 专利 · Tab Activeness Indication | 浏览器内 contextual RAG:如何让 LLM 感知 Tab 的活跃度信号 |
| 2024 | 专利 · Efficient Webpage Saving And Visiting | 高效网页保存与访问机制 |
| 2024 | ICONIP 2024 · Mixture of Rationale | 多模态推理中的 rationale 混合 |
| 2025 | ICASSP 2026 一作 · WebRouter (VIB) | Cost-sensitive query routing:给每个 query 挑最合适的模型 |
| 2026 | AAAI 2027 在投一作 · What Is a Skill Worth? | Skill unit-level evaluation:从"整包一个分"下沉到"每个 unit 一个分" |
输入面演进:从「当前页面」扩展到「全 M365 + Copilot 记忆」。
| 阶段 | 输入范围 | 承载产品 |
|---|---|---|
| 2023 | 当前页面 | 侧边栏长文总结 |
| 2024 | + 历史 / 收藏 / 多 Tab | Browse-for-me、Tabs 自动治理 |
| 2025 | + 多轮会话上下文 | Contextual Chat |
| 2026 | + 全 M365 + Copilot 记忆 | Intent / Journeys / Blueprints |
输出面演进:从「文本」扩展到「图文任务卡 + 网页改造 + 直接执行」。
| 输出形态 | 承载产品 | 关键指标 |
|---|---|---|
| Tabs 分组 | Tabs Auto Grouping(2023) | 百万级 DAU,Tabs 业务盘子 3× |
| 文本对话 | Contextual Chat(2025) | SSR 76%→90%,Action 50%→90%,延迟 10s→1s |
| 可视任务卡(Image) | Journeys(2026 全球首发) | W1 retention 29% → 32% |
| 网页改造 | Web Blueprints(2026) | Edge 148 Canary |
| 直接执行(Action) | Browser Agent / Vision Action | React Loop 统一调度 |
↓ 视角 C · Memory 视角详见下一小节
一句话概括:Edge 的每一个 AI 能力,本质上都在解一个 memory 问题。 我在做的是把这些散点串成一条 hierarchy——每一层都有代表项目、真实用户量与线上指标。
| 层级 | Memory 类型 | 代表项目 | 角色定位 |
|---|---|---|---|
| L1 | Short-term Activity Memory |
Tabs Auto Grouping 全球首发 · 领先 Google 12 个月 |
浏览器 short-term activity 的第一次结构化:把打开的 Tabs 从「未组织的临时状态」升级为「可被 LLM 理解的会话记忆」 |
| L2 | Working Memory | Contextual Chat + RAG | 多页面 / 历史 / 收藏统一为模型上下文;意图路由长期演进以在效果 / 延迟 / 成本三角上再平衡 |
| L3 | Episodic Long-term Memory |
Journeys 全球首发 |
把长期浏览意图从时间流里抽取成主题化的 episodic memory,可视化为任务卡 |
| L4 | Team Organizational Memory |
Sociemate EdgeML 内部上线 |
四层可插拔 agent 架构 + per-user 身份隔离 + team-memory 共享层,让「人 + agent」共用同一份组织记忆 |
| L5 | Skill Memory | AAAI 2027 在投一作 Skill Crediting |
Unit 粒度的 skill memory 评估与治理:保留 / 压缩 / 删除决策,驱动 skill 库自动裁剪与再训练 |