110亿参数搞定六大科学任务,上智院「神珍」模型到底怎么做到的
技术笔记 3 次阅读

110亿参数搞定六大科学任务,上智院「神珍」模型到底怎么做到的

神珍模型封面

110亿参数搞定六大科学任务,上智院「神珍」模型到底怎么做到的

最近看到一条消息挺让人兴奋的。上海科学智能研究院(上智院)放出了一个叫「神珍」的科学多模态基础模型,号称用一个模型搞定DNA、RNA、蛋白质、小分子、地球系统和医学影像六类任务。参数才110亿,但某些任务上的表现居然能跟万亿参数级别的模型掰手腕。

说实话,一开始我是抱着怀疑的态度看的。毕竟在AI for Science这个领域,大家习惯的做法是各走各路——搞气象的用一套模型,搞蛋白质的用另一套,各玩各的。但上智院这次的路子不太一样。

为什么选择「不把所有数据塞进一个格式」

现在主流的做法,是把不同类型的数据统统转成token序列,然后喂给大模型去学。但「神珍」团队换了个思路。

他们用的主干是Qwen3-VL-8B,但给每类科学数据都单独设了一条处理通路。蛋白质和核酸仍然按序列处理,小分子按结构处理,气象场保持空间分布,医学影像保留图像细节。说白了就是——不改数据的原生形态,而是在进入共享模型之前,各自用自己的方式先做预处理。

这个思路挺有意思的。因为序列数据强调的是前后依赖,分子数据看的是原子之间的连接关系,气象场看的是时空演化,医学影像关注的是局部病灶。硬把它们转成同一种格式,肯定会有信息损耗。

训出来的结果也说明这条路走得通。在20项生物序列任务中,「神珍」有9项拿了三款参评模型里的最优,17项排在前二。跟万亿参数的Intern-S1-Pro比,两边各赢了10项。这一点很关键——它证明了参数规模不是衡量科学模型能力的唯一维度。

到底能干啥

「神珍」能干的事情比我想象中多。除了常规的文本问答,它还能直接生成RNA序列、SMILES分子表示、全球气象场,甚至能做医学影像分割。

拿气象来说,给定一帧初始大气场,模型每6小时滚动预报一次,能一直推到第10天。而且在第10天的预报里,500hPa位势高度、2米温度、海平面气压这些关键指标,达到了业务级数值预报的水平。作为一个通用模型,能做到这一步不容易。

医学影像分割这块也挺亮眼。在覆盖CT、MRI、病理等九种影像模态、超过十万个图文样本的测试中,Dice得分平均91.20,在7种参比方法里最好。九类影像中五类排第一,其余四类排第二。

开放程度

这一点我比较欣赏。他们不只是放了个模型权重,还同步提供了推理代码、示例脚本、详细的使用文档,以及气象预报和医学影像分割所需的配置文件。你可以本地部署,也可以接进现有的科研流程。

你可以去他们那个叫「星河启智」的开放平台下载模型或者调用API,也能在Hugging Face上拿到权重,GitHub上拿推理代码。

「神珍」这个名字取自《西游记》里的天河定底神珍铁——就是孙悟空那根定海神针。团队的意思也很清楚:希望这套模型能成为一个相对轻量但又覆盖面广的科学基础工具,让更多做科研的人能用上、用得起。

反正就我个人观察,科学AI这两年确实在从「各领域各自为战」走向「统一建模」,而「神珍」算是这条路上一个挺实在的里程碑。至于能不能真的成为科学智能领域的「定海神针」,还得看后续社区怎么用它、怎么反馈了。

分享

评论 (0)

评论通过后显示

暂无评论,来写第一条吧 ✍️