AI Agent Infra System

由 AetherStation 一体化部署到边端

01/ HARDWARE & INFRA

AetherStation

AetherStation 边缘智能体工作站

SOFTWARE

Tamer动态任务理解、运行时编排、执行状态机

EDGE AI AGENT INFRA

AttuneAgent 能力调谐与边缘部署中心
AetherInfer Engine量化 / 投机解码 / KV Cache Management

HARDWARE

ChipsNVIDIA / 昇腾 / 摩尔 / Intel 等异构算力

版本介绍 VERSION

A / 国产版(信创)

AetherStation 国产版

国产信创 Agent Appliance

国产芯片全栈 · 数据不出域 政务 / 金融 / 医疗

核心配置
摩尔 GPU + 后摩 NPU ×2 370 TOPs INT8 国产异构算力
典型场景
政务公文 · 金融合规审核 医疗病历分析 · 制造知识库

B / 标准版(NV)

AetherStation Standard

High-performance Agent Workstation

国产芯片全栈 · 数据不出域 政务 / 金融 / 医疗

核心配置
NV GPU + 以太推理引擎 Qwen3.6-27B:单发120tok/s,16并发630tok/s 35B MoE · 20并发(50人以下)
典型场景
代码 Agent · 数据分析 企业工作流 · 企业助手

02 / ENTERPRISE WORKFLOWS

ATTUNE:让本地小模型胜任复杂企业工作流任务

不改变基座模型权重,Attune 在 15 项工作流任务上达到 Teacher 水平,其中 13 项获得 held-out 满分。

15项行业任务,13项满分

工作流任务通过率(%)

  1. 合规告警
  2. 笔录抽取
  3. 智能家居
  4. 车机控制
  5. 政务路由
  6. 客服路由
  7. 运维工单
  8. 合同抽取
  9. 病历抽取
  10. 工业边缘
  11. 质检分类
  12. 信贷抽取
  13. 理赔抽取
  14. 报销抽取
  15. 机器人指令

03 / INFERENCE PERFORMANCE

AetherInfer Engine:释放生产级推理性能

AetherInfer 面向高吞吐、低延迟与多并发 Agent 工作负载,通过硬件与自研推理栈协同优化,提高单位硬件投入的实际交付效率。

12.58×︎
单批输出速度
124 tok/s vs 9.86 tok/s124 vs 9.86 tok/s
4.92×︎
16 并发总吞吐
630 tok/s vs 128 tok/s630 vs 128 tok/s
210
16 tok/s per ¥︎10K16 tok/s / ¥︎10K
单位投入吞吐DGX ¥︎31,900 · Aether ¥︎30,000
AetherStation Standard
210
AetherStation Lite
110
DGX Spark · MTP
72.6
DGX Spark · no MTP
40.1

优势硬件与自研推理栈协同优化,而不是单纯堆叠 GPU

04 / THEORETICAL EFFECT

完成常见企业任务时,单任务成本并非线性降低

100名活跃员工 · 年度约200万次工作流 · 工作流均达到Attune验证的同等任务效果

1.0XAetherStation 基准

企业任务部署方案的单任务成本、运维复杂度与初次投入对比
部署方案完成单任务成本运维复杂度与成本初次投入成本
8×A100 · Qwen 27B30–40×90万-120万
8×H100 · Qwen 27B11.9×220万-300万
GLM-5.2 · 官方API11.7×API调用付费
12×B300 · NVIDIA官方优化 · GLM-5.210.3×千万级

测算说明:以上为特定任务量、模型、并发、硬件与服务价格假设下的理论比较,用于展示成本结构,实际结果会随部署条件变化。