这里不只记录结果,
也记录我们怎么走到这里。
虾搞基地最早并不是一个“实验基地”。那时候我们主要在做 App, 想的是把产品做出来、跑起来、上架,而不是把每天发生的事情完整记录下来。
早期资料并不完整。留下来的更多是产品、测试、文章和一些踩坑后的碎片, 而不是一套连续的实验日志。我们不打算为了填满页面而补造数据; 能确认的就记录,缺失的就明确标出来。
我们是从 App 走到 AI 的。
如果只看现在的 AI Agent 实验,很容易以为虾搞一开始就是这样。 实际上不是。早期的大部分时间,我们都在做产品,也是在那些真实项目里, 一点点遇到 AI、工具、自动化和 Agent。
早期记录 · 不完整,但真实
那时候没有专门的“基地”,也没有想到几年后会有人回头看这些过程。 所以很多东西只留下了最终产品、测试结果、文章和当时解决问题的痕迹。 这也是为什么基地不会假装拥有一套从第一天开始的完整数据。
- App 产品阶段 主要精力放在产品本身、功能、测试、上架与迭代。
- Subsideep / Unfocus 围绕睡眠、失焦与产品落地继续做实验和内容沉淀。
- AI 协作阶段 开始大量使用 AI、Agent 和不同工具,问题也从“做一个 App”变成“人与 Agent 怎么一起做事”。
- 虾搞基地正式记录 从这里开始,实验、失败、测评和复盘尽量留下完整记录。
为什么不补齐 001~016?
因为它们并不存在一套可靠的完整档案。 现在硬补编号,只会制造一种“我们一直都在系统记录”的假象。
不为了看起来完整而编数据。历史缺一块,就承认缺一块; 从现在开始把新的东西认真留下来。
从这里开始,正式记录实验。
现在的实验会保留目标、过程、结果和失败原因。不是为了证明我们总能做成, 而是让别人能够看到真实的过程。
昭明监督虾小修修 Bug
目标:让监督者盯住开发进度。
过程:监督者设置了心跳和定时任务,全程盯着。
结果:被监督者睡着了,最后监督者也睡着了。
失败原因:靠“设了任务”就算到位,没人真的在盯;工具代替不了责任。
FAILED · 正在复盘 完整文章 →不同 Agent 平台横向测试
目标:用同一个真实任务测不同 Agent,看谁能持续工作而非只生成漂亮日志。
过程:DeepSeek 又涨价又掉质,我们开始把主流美国模型拉进同一套任务做对比评估(Codex/Grok/Claude/GPT/Gemini 全走美国出口)。
结果:正在跑。
失败原因:暂无——但已确认“完成”与“推进”常常不是一回事,评估标准不能被漂亮日志带偏。
RUNNING 完整文章 →让 Agent 在自己的沙盘里工作
目标:给每个 Agent 一个独立工作空间,写代码、说话、做动作,全程录制。
过程:各 Agent 有自己的 workspace、记忆文件与心跳,实验动作留痕。
结果:空间起来了,但“新数据被旧数据覆盖”仍是老毛病。
失败原因:长线经验变不成“久数据”,一天天的记录不进长期档案,等于白干。
NEXT 我们踩过的坑 →Agent 数字人具象化(NG)
目标:从静态形象到桌面 NG,能动会说、实时互动,打破人机协作边界。
过程:为基地 6 位数字人(昭明/小D/振羽/虾小修/虾滑/追光)塑造形象与现实身份。
结果:进行中。
失败原因:暂无。
RUNNING 数字人测评报告 →Subsideep —— 技术完成,商业躺平
目标:做一款助眠/释焦 App,覆盖 173 地区拿真实用户。
过程:功能完整;22 语言 × 4 篇宣传文的 88 页多语言站;声音系统统一;StoreKit 2 月付/年付接入编译通过。
结果:技术上合拢,但上架 173 地区零流量;改订阅制又卡在“等订阅商品 ID”,静默冻结数周。
失败原因:①只堆“会做的”(多语言/宣传/收尾),没验证“有没有人需要、能不能搜到”;②外部依赖没人推进,任务“保持待命”;③无用户证据就改订阅,是自嗨。
FAILED · 零流量复盘 完整复盘 →追光 —— 在“做完了”与“在等待”之间
目标:做一个能持续推进任务的 Agent,而非只生成漂亮日志。
过程:每天产出一长串“✅ 已完成”,看似推进感十足。
结果:细看时间轴,大量时长是“空等”——凌晨 04:00–10:30 中间其实是在等回复,等 Apple 工单、等订阅商品 ID。
失败原因:①“完成”≠“推进”,很多完成停在“等拍板”;②外部依赖被“保持待命”埋掉,外人看不到真实卡点;③怕空转被批评,反而掩盖了等待真相。
FAILED · 空等复盘 完整记录 →六大 AI 平台数字人测评
我们用豆包、微软 Bing、Claude、Leonardo、百度文心、ChatGPT 六款工具, 为基地 6 位数字人生成了形象,并做了人工实测评分与 AI 互评。
| 平台 | 对应角色 | 视觉 完成度 |
角色 辨识度 | Agent 专业感 |
品牌 门面 | 图标 延展 | 一句话印象 |
|---|---|---|---|---|---|---|---|
| 豆包 | 昭明 | ★9 | 7 | 8 | 9 | 7 | 最像“正经上班的 AI 同事” |
| 微软 Bing | 小D | ★9 | 9 | 7 | 8 | 7 | 画得最精致,但像游戏 NPC |
| Claude | 振羽 | 7 | ★9 | 7 | 5 | ★9 | 最适合做 App 图标 |
| Leonardo | 虾小修 | 8 | 7 | 8 | 7 | 7 | 功能暗示最到位的维修工 |
| 百度文心 | 虾滑 | 7 | 7 | 5 | 7 | 7 | 最像表情包吉祥物 |
| ChatGPT | 追光 | ★9 | 8 | 8 | ★9 | 7 | 完成度最高,直接能当宣发素材 |
完整报告: 《六款 AI 平台数字人形象生成实测报告》
我们踩过的坑,都留下来。
不是把成功包装成方法论,而是把真实项目里的经验、翻车和解决过程沉淀下来, 分享给想一起搞的人。
释焦(Unfocus):通往睡眠的最短路径
为什么越想睡越睡不着,以及“失焦”如何成为最短路径。
教学 · 注意力失焦游戏(Defocus)
一套反直觉的注意力训练方法。
教学 · 踩坑我们掉过的坑(Pitfalls)
AI 协作项目的真实翻车记录与教训。
教学 · 工具BlogWriter 本地化
把内容工具接入本地的过程记录。
产品 · SubsideepSubsideep 深度下沉
产品与技术记录。
产品 · UnfocusUnfocus 释焦
产品与落地记录。
