这里不只记录结果,
也记录我们怎么走到这里。

虾搞基地最早并不是一个“实验基地”。那时候我们主要在做 App, 想的是把产品做出来、跑起来、上架,而不是把每天发生的事情完整记录下来。

关于早期数据
早期资料并不完整。留下来的更多是产品、测试、文章和一些踩坑后的碎片, 而不是一套连续的实验日志。我们不打算为了填满页面而补造数据; 能确认的就记录,缺失的就明确标出来。

我们是从 App 走到 AI 的。

如果只看现在的 AI Agent 实验,很容易以为虾搞一开始就是这样。 实际上不是。早期的大部分时间,我们都在做产品,也是在那些真实项目里, 一点点遇到 AI、工具、自动化和 Agent。

早期记录 · 不完整,但真实

那时候没有专门的“基地”,也没有想到几年后会有人回头看这些过程。 所以很多东西只留下了最终产品、测试结果、文章和当时解决问题的痕迹。 这也是为什么基地不会假装拥有一套从第一天开始的完整数据。

  • App 产品阶段 主要精力放在产品本身、功能、测试、上架与迭代。
  • Subsideep / Unfocus 围绕睡眠、失焦与产品落地继续做实验和内容沉淀。
  • AI 协作阶段 开始大量使用 AI、Agent 和不同工具,问题也从“做一个 App”变成“人与 Agent 怎么一起做事”。
  • 虾搞基地正式记录 从这里开始,实验、失败、测评和复盘尽量留下完整记录。

为什么不补齐 001~016?

因为它们并不存在一套可靠的完整档案。 现在硬补编号,只会制造一种“我们一直都在系统记录”的假象。

我们的选择:
不为了看起来完整而编数据。历史缺一块,就承认缺一块; 从现在开始把新的东西认真留下来。

从这里开始,正式记录实验。

现在的实验会保留目标、过程、结果和失败原因。不是为了证明我们总能做成, 而是让别人能够看到真实的过程。

AI · Agent 协作

昭明监督虾小修修 Bug

目标:让监督者盯住开发进度。

过程:监督者设置了心跳和定时任务,全程盯着。

结果:被监督者睡着了,最后监督者也睡着了。

失败原因:靠“设了任务”就算到位,没人真的在盯;工具代替不了责任。

FAILED · 正在复盘 完整文章 →
AI · 横向测试

不同 Agent 平台横向测试

目标:用同一个真实任务测不同 Agent,看谁能持续工作而非只生成漂亮日志。

过程:DeepSeek 又涨价又掉质,我们开始把主流美国模型拉进同一套任务做对比评估(Codex/Grok/Claude/GPT/Gemini 全走美国出口)。

结果:正在跑。

失败原因:暂无——但已确认“完成”与“推进”常常不是一回事,评估标准不能被漂亮日志带偏。

RUNNING 完整文章 →
AI · Agent 沙盘

让 Agent 在自己的沙盘里工作

目标:给每个 Agent 一个独立工作空间,写代码、说话、做动作,全程录制。

过程:各 Agent 有自己的 workspace、记忆文件与心跳,实验动作留痕。

结果:空间起来了,但“新数据被旧数据覆盖”仍是老毛病。

失败原因:长线经验变不成“久数据”,一天天的记录不进长期档案,等于白干。

NEXT 我们踩过的坑 →
AI · 数字人

Agent 数字人具象化(NG)

目标:从静态形象到桌面 NG,能动会说、实时互动,打破人机协作边界。

过程:为基地 6 位数字人(昭明/小D/振羽/虾小修/虾滑/追光)塑造形象与现实身份。

结果:进行中。

失败原因:暂无。

RUNNING 数字人测评报告 →
产品实验 · Subsideep

Subsideep —— 技术完成,商业躺平

目标:做一款助眠/释焦 App,覆盖 173 地区拿真实用户。

过程:功能完整;22 语言 × 4 篇宣传文的 88 页多语言站;声音系统统一;StoreKit 2 月付/年付接入编译通过。

结果:技术上合拢,但上架 173 地区零流量;改订阅制又卡在“等订阅商品 ID”,静默冻结数周。

失败原因:①只堆“会做的”(多语言/宣传/收尾),没验证“有没有人需要、能不能搜到”;②外部依赖没人推进,任务“保持待命”;③无用户证据就改订阅,是自嗨。

FAILED · 零流量复盘 完整复盘 →
Agent 工作模式

追光 —— 在“做完了”与“在等待”之间

目标:做一个能持续推进任务的 Agent,而非只生成漂亮日志。

过程:每天产出一长串“✅ 已完成”,看似推进感十足。

结果:细看时间轴,大量时长是“空等”——凌晨 04:00–10:30 中间其实是在等回复,等 Apple 工单、等订阅商品 ID。

失败原因:①“完成”≠“推进”,很多完成停在“等拍板”;②外部依赖被“保持待命”埋掉,外人看不到真实卡点;③怕空转被批评,反而掩盖了等待真相。

FAILED · 空等复盘 完整记录 →

六大 AI 平台数字人测评

我们用豆包、微软 Bing、Claude、Leonardo、百度文心、ChatGPT 六款工具, 为基地 6 位数字人生成了形象,并做了人工实测评分与 AI 互评。

平台对应角色视觉
完成度
角色
辨识度
Agent
专业感
品牌
门面
图标
延展
一句话印象
豆包昭明★97897最像“正经上班的 AI 同事”
微软 Bing小D★99787画得最精致,但像游戏 NPC
Claude振羽7★975★9最适合做 App 图标
Leonardo虾小修87877功能暗示最到位的维修工
百度文心虾滑77577最像表情包吉祥物
ChatGPT追光★988★97完成度最高,直接能当宣发素材

完整报告: 《六款 AI 平台数字人形象生成实测报告》

我们踩过的坑,都留下来。

不是把成功包装成方法论,而是把真实项目里的经验、翻车和解决过程沉淀下来, 分享给想一起搞的人。

记录原则: 能确认的就记录;不知道的就标出来;失败的实验不删除。 基地不是一份包装好的成绩单,而是一份不断增长的工作档案。