封面

【3A大作】如何用大肥鱼制作一个初音未来桌宠

提醒:仅供娱乐,这只是简单学习研究的小家伙而已。

我是一个AI小白,一开始只是摸索了一下,发现有点意思,所以想试试看看能不能成功。以前用的12年的惠普EliteBook 2570P,配置太感人,完全杜绝AI模型了。前几天,才刚找群友3000淘了一个二手的天选3plus,小试牛刀。配置如图。

初音未来,AI,桌宠
初音未来,AI,桌宠
初音未来,AI,桌宠

【本地部署】【国内方案】

1.【下载AI】最方便的方法,就是从微软应用商店下载ChatGPT,Codex就包含在软件里面,左上角切换,但是我并没有使用OpenAI官方的API。

2.【购买API】由于财力不很雄厚,因此购买了更便宜的DeepSeek大肥鱼的API。(为何不用DeepSeek Harness?没办法,我看的教程就是这样的,用习惯了)

初音未来,AI,桌宠

3.【替换模型】下载CC Switch,点击Codex,上面有增加供应商,点击进入页面找到DeepSeek点入,只要填写API Key就可以了,点击“切换”,这样就可以把Codex供应商替换成DeepSeek,这样就可以免登录直接进入Codex。

初音未来,AI,桌宠
初音未来,AI,桌宠
初音未来,AI,桌宠

4.【图画来源】图片素材方面,你可以选择现成的AI,GPT-image或者部署其他模型,我先是测试了我的电脑GPU是8G,RTX3070ti,可以跑NovelAI,完全没问题,所以用了更新一点的Animagine4,套用了ComfyUI,更加直观方便。

初音未来,AI,桌宠

5.【声音来源】角色语音方面,我前天之前对VC语调挺感兴趣的,后面接触到花儿不哭大佬的RVC,直到现在看到了语音模型GPT-SoVit,我觉得赶上好时候了。为了节约成本,直接利用了现有的社区语音模型,【源Kelvin】的初音未来语音,还下载了【流明风P】的洛天依语音。

初音未来,AI,桌宠
初音未来,AI,桌宠

6.【实战环节】现在的大肥鱼还算聪明,你说造一个桌宠还是可以很不错的搭建基本框架的,但是很多细节和错误仍要注意:

①人物形象一致性:如果不是弄像Live2d那样的动态角色,静态的一定要保持角色形象比较固定。

初音未来,AI,桌宠
初音未来,AI,桌宠

②表情丰富:最好是只更改面部表情部分比较保险,我参考了【LingChat】项目里面,生成多张角色立绘(最好情绪丰富一些),这里我由于是基础尝试向,就只弄了四张。如果要可用,10张左右及以上是比较推荐的。

初音未来,AI,桌宠

③语音质量:由于我是本地跑的,因环节、性能配置、次数和运气等的影响,有一部分语音过长或截断不完整,出现胡言乱语或者说外国话的情况,所以最好多次筛选和验证语音长度、语音相似度和dB分布,因为调出来不像角色很难受。

初音未来,AI,桌宠

④实际使用:我前文主要说的是自己在本地部署的情况,如果要离线使用或者分享,简单的可以存50-150左右语音台词,大小会在5MB左右和以下。如果追求“实用”,最好增加台词语音和表情数量,并且别忘了检查图片与音频质量。

7.【分享发布】由于考虑到文件一般比较小,百度还是蓝奏都会比较轻松发布和下载。

初音未来,AI,桌宠

8.【扩展升级】因为桌宠软件依赖固定媒体资产,并且功能简单,你可以选择添加或者升级某些方面。例如回复消息和更换背景,再要么是一些娱乐向插件和游戏。如果开源的话,那是最好的。

发布评论
全部评论(0)