AI是如何把照片变成异世界物种的
深入解析异界拾光小程序的AI技术链路:从拍照识别到物种转化、AI生图、剧情生成的完整流程
星之谣科技
星之谣科技
你拍下一张路边小草的照片,几秒钟后,它在你的手机里变成了一株”荧光苔藓”——异世界里的稀有植物,还附带了一段星灵伙伴的惊叹对话。
这不是魔法,是AI。本文将拆解「异界拾光」背后的AI技术链路。
一、整体流程
异界拾光的AI流程分为四个阶段:
拍照 → AI识别 → 异世界转化 → AI生图 → 剧情生成
每个阶段调用不同的AI模型,共同完成”把现实变成奇幻”的体验闭环。
二、AI识别:看懂照片里是什么
模型选择
我们使用视觉多模态模型(hunyuan-vision / hy3-preview)进行图片识别。这类模型能同时理解图片内容和文字指令,一次调用完成”看图+分类+描述”。
提示词设计
识别提示词的核心是:让AI不只识别物种,还要转化为异世界形态。
{
"realName": "现实物种名称",
"fantasyName": "异世界风格的奇幻名称",
"category": "plant/animal/insect/scenery/object/food/other",
"setting": "异世界形态描述(外观、特性)",
"usage": "在异世界中的特殊能力或用途",
"emotion": "愉悦/惊讶/好奇/害怕/兴奋"
}
一次API调用,返回完整的物种档案,无需多次请求。
关键挑战
- 识别准确率:角度差、光线暗、遮挡都会影响识别。我们通过提示词引导AI”不确定时给出最可能的猜测”
- 响应速度:视觉模型调用约3-8秒,加上网络延迟,用户等待时间需控制在10秒内
- 内容安全:所有上传图片先经过微信security.imgSecCheck审核,违规图片直接拒绝
三、AI生图:把描述变成插画
模型选择
使用文生图模型(hy-vision-2.0-instruct),根据物种的奇幻名称和设定描述生成插画。
提示词策略
幻想风格插画,异世界奇幻美学,梦幻光影,发光粒子。
主体:{fantasyName},{setting}
风格:{世界观风格关键词}
构图:居中,全身,细节丰富
关键点是关闭revise(提示词优化),确保AI按原始提示词生成,而非”自作主张”修改。
异步生成
生图耗时较长(10-30秒),我们采用异步策略:
- 识别完成后立即返回结果
- 后台异步调用生图
- 生成完成后更新数据库
- 用户下次查看详情页时自动加载
这样用户无需等待生图完成,体验更流畅。
四、剧情生成:让每个物种都有故事
这是最难的部分
识别和生图都是”一次调用解决问题”,但剧情生成需要连贯性——同一世界观下的故事要前后呼应,不能每次都是独立的片段。
前情提要机制
// 查询同世界观最近3章已生成剧情
const recentChapters = await db.collection('species')
.where({ worldview: currentWorldview, openid })
.orderBy('storyGeneratedAt', 'desc')
.limit(3)
.get()
把这3章的标题和摘要作为”前情提要”注入提示词,让AI知道之前发生了什么。
反模板化设计
早期版本的剧情高度模板化——16篇里有13篇开头几乎一字不差。我们通过以下方式解决:
- 开篇哈希选择:用物种ID的哈希值从8个开篇角度中选一个,避免雷同
- 人格对话指引:星灵有3种人格(好奇/傲娇/温柔),不同人格的对话风格完全不同
- 禁用模板句清单:提示词中明确列出”禁止使用的句式”
起承转合结构
每篇剧情500-800字,采用四段式结构:
| 段落 | 内容 | 字数 |
|---|---|---|
| 起 | 星灵与主人在异世界探索时发现物种 | ~100字 |
| 承 | 接近、观察、与物种互动 | ~200字 |
| 转 | 遇到小冲突或意外 | ~150字 |
| 合 | 化解冲突,获得感悟 | ~150字 |
五、技术栈总结
| 功能 | 模型 | 调用方式 |
|---|---|---|
| 图片审核 | 微信security.imgSecCheck | 云函数 |
| 图片识别 | hunyuan-vision / hy3-preview | TokenHub API |
| 星灵对话 | hunyuan-turbos-latest | TokenHub API |
| 文生图 | hy-vision-2.0-instruct | TokenHub API |
| 剧情生成 | hunyuan-turbos-latest | TokenHub API |
所有AI调用通过云函数中转,API Key存储在服务器端,前端不接触密钥。
六、AI内容的标识
根据《生成式人工智能服务管理暂行办法》要求,所有AI生成内容均明确标识:
- 对话页面显示固定提示”内容由AI生成,仅供参考”
- AI生成的插画带有”AI生成”角标
- 剧情页面标注”AI生成内容”
这不仅是合规要求,也是对用户的诚实。
结语
把照片变成异世界物种,看似是”一个AI功能”,实际上需要识别、生图、剧情三个AI模型的协同,加上前情提要、反模板化、异步生成等工程手段,才能呈现出连贯的奇幻体验。
AI不只是一个工具,它是创造情感体验的画笔。