本文提出 TinySR,一种面向真实世界图像超分辨率的轻量级扩散模型,通过深度剪枝、动态块间激活以及扩张‑腐蚀策略实现高效推理。 ...
AI编程系统化工程方法论-让AI开发从随意尝试变为可靠工程当下多数人使用AI编程时,遇到的代码问题大多并非AI编码失误,而是人机需求未充分对齐导致AI只能自主脑补逻辑、适配需求。常规的AI编程仅停留在“整点东西玩玩”的零散尝试层面,想要将其升级为标准化、可落地、可迭代的可靠系统工程,核心依靠三大闭环 ...
大家好,我是R哥。 距离《Spring AI 2.0 正式发布,让 Java 再次伟大!!》已经 2 个多月了,Spring AI 2.0.1 来了,这是 2.0.0 GA 之后的第一个维护版本。 可能看到 2.0.1,很多人的第一反应可能是小修小补,这次真不能只看版本号,东西还不少呢。 Sprin ...
单个AI智能体受限于单一视角,企业落地更需要分工明确的多智能体协作。本文结合奇摩团队的WorkBuddy实践,拆解Writer、Reviewer、Image-Gen、Publisher四类角色的协作链路,并以真实数据对比人工模式与智能体流水线的效率差距。 ...
为什么需要认真设计评估
AI工具要上线,不能光靠几个手工例子拍脑袋。就像给生产API写单元测试一样,AI代理需要一套自动评估机制,才能持续知道它好不好用。但评估要烧token,所以设计评估本身就需要花心思。设计不好,不仅浪费钱,还可能给出错误信号,让你误判产品的真实水平。
先摸清评估框架的脾气
不同... ...
普通聊天模型答错可能只是体验问题,能读文件、发邮件、执行代码的 Agent 答错就可能变成真实损失。安全不能依赖一句“请勿执行危险操作”,而要贯穿输入、模型、工具和运行环境。 Prompt 注入利用了数据与指令混在一起 网页、邮件和文档中可能包含诱导模型忽略规则的文字。外部内容必须标记为不可信数据, ...
今年有个明显的趋势,大伙对AI公司的表演祛魅,那些所谓深夜王炸产品,花心思一追一个不吱声,开始更多关注AI工作流,如何提高个人的生产力。 ...
评价聊天回答可以看正确性和表达,评价 Agent 还要看它是否选对工具、走了多少步骤、有没有恢复失败、成本是否合理,以及副作用是否受控。只看最终文本,会错过大部分真实问题。 把结果指标和过程指标分开 结果指标包括任务成功率、事实正确性和用户接受度;过程指标包括工具选择、参数正确率、步骤数、延迟、to ...
先说结果:下面这 4 张海报,从我发出指令到拿到图片,大约 1 分钟。 我不会美工,也没有打开 Photoshop。用的工具,是我之前用 WorkBuddy 做的一个海报生成器。这个生成器本身也没花几分钟,具体开发过程我在上一篇文章里写过。 这次我把海报生成器的网址、产品截图和要求一起发给 Work ...
作者:张富春(ahfuzhang),转载时请注明作者和引用链接,谢谢! cnblogs博客 zhihu Github 公众号:一本正经的瞎扯 背景 为了早点搞懂公司的百万行 C# 的祖传代码,我想在缺乏文档、缺乏帮手的情况下,先建立一个 企业知识库 来快速帮我理清头绪。 一开始,我是打算以 weav ...
Agent 生态扩大后,最先出现的并不是“模型不够聪明”,而是连接成本:每个工具都要适配,每个 Agent 都用自己的消息格式,身份和权限也无法统一。协议的价值,是减少这种点对点胶水代码。 三类协议关注不同边界 MCP 更关注模型应用怎样发现和调用外部工具、资源与提示;A2A 关注 Agent 之间 ...
金融大模型听起来像是只有华尔街和巨头才玩得起的东西——BloombergGPT 训练一次要花约 267 万美元、跑 53 天、动用 512 张 A100。但 FinGPT 用一条完全不同的路线把它拉到了桌面级:开源、轻量微调、单张消费级显卡就能跑出同样的效果,甚至在某些金融情感分析基准上跑赢了 GP ...
定时任务是企业管理中最容易掉链子的环节,本文介绍如何用WorkBuddy搭建调度执行反馈三层闭环的定时任务自动化,并附真实数据对比。 ...
本文介绍一个支持文本、图像、视频三类资源统一入库与检索的跨模态知识库系统。三类资源经统一向量化后进入同一向量空间,用户只需输入一句自然语言,即可一次性召回三种模态的相关资源,并按类型直观展示。 ...
多 Agent 很有吸引力:规划者、研究员、开发者和审查者各司其职。但如果任务本身没有清晰边界,把一个 Agent 拆成五个,通常只会增加消息、成本和责任推诿。 先判断是否真的需要拆分 适合多 Agent 的任务往往可以并行、需要不同工具或上下文,或者存在明确的生产与审核角色。线性短任务、共享状态高 ...
当初学专业的笔记还在吗?相信大部分人都没保留,而能力在不断积累和更新,关注和思考的角度在变化,在AI蒸馏我们的同时。也可以用AI的能力,去蒸馏一下魔幻的职场。 ...
信息化数字化智能化,十年前的说法在逐步兑现。最后回到一个灵魂拷问:当业务运营更加高效。组织间的协作更加流畅,企业究竟想去拓宽市场,还是手起刀落降低成本? ...
Agent 底座很容易走向“大而全”:模型、工具、记忆、渠道和界面全部互相依赖。DeepSeek Harness 的插件化思路提醒我,扩展能力的关键不是不断改核心,而是让核心保持小,让变化通过清晰协议接入。 “一切皆插件”的前提是协议稳定 模型 Provider、工具、记忆后端、事件处理器和界面都可 ...
实测:WorkBuddy自动发小某书,账号差点违规 我替大家试过了:现阶段,不建议用 WorkBuddy 自动发布小某书。 前几天我做了一个实测:让 WorkBuddy 通过自动化浏览器完成小某书内容发布。结果没过多久,账号就收到了“疑似使用第三方工具或脚本自动浏览、查看或发布内容”的违规预警。 我 ...
清华、浙大与美团 LongCat 团队合作的 AgentOPSD,目前挂在 Arxiv 26.08 上,做的是长程多轮 Agentic RL 里的回合级信用分配。可验证奖励的 RL 只在整条轨迹结束时给一个稀疏的 0/1 信号,GRPO 这类方法把轨迹级优势均匀广播到每个 token,无法把成败真正 ...