输入 · 多模态语料
arXiv 论文精读
搜 arXiv 元数据、把论文重排成能划词能翻译的站内正文:正文/PDF 双引擎、逐段译文、全文总结与思维导图。
它解决什么,不解决什么
读英文论文卡在两处:排版(双栏、公式、脚注)和语言(长难句、术语)。这个模块干的是把论文抓进站内重排成可划词、可翻译、可存生词本的页面,而不是给你一个 PDF 阅读器。
页面顶部就把立场写明了:LinguaFlow 是非官方学习阅读器,元数据来自 arXiv API,正文按需抓取供个人学习,以 arXiv.org 为准。它不做文献管理、不出引用格式,别当 Zotero 用。
入口在 /arxiv。这个模块是否在顶部导航里出现由平台配置决定;被关掉时搜索会直接回一句「arXiv 阅读未启用」。
搜索框其实认三种写法
输入框的提示是「例如 transformer、cs.CL 或 2301.07041」,对应的行为:
- 一个 arXiv ID(
2301.07041,带v2版本号也认):跳过检索,直接定位那一篇 - 加引号的短语(
"mixture of experts"):整个短语一起匹配 - 普通关键词:每个词都要命中,词越多结果越少;分类号
cs.CL也是当普通词输进去
几条口径,搜不出来先对照这里:
| 行为 | |
|---|---|
| 长度 | 关键词最长 200 个字符 |
| 排序 | 固定按相关度,页面上没有排序开关 |
| 分页 | 每页条数由平台配置,底部只有「上一页 / 下一页」 |
| 结果行 | 「共 N 条 · C1–C2 · 缓存」= 命中平台已有结果;「实时」= 刚去 arXiv 问过 |
「C1–C2」是这一模块的固定标注,每一篇都挂着同一个标签,不是按这篇的语言难度算出来的——别拿它当选文依据。
未登录可以搜、可以读摘要,但点「站内阅读」会被送到登录页,登录完自动回到那一篇。登录后,搜索框留空时会给你「最近阅读」(最多 20 条)。
正文和 PDF 不是一回事
论文页必须登录才能打开,右上角用「正文 / PDF」切换。能拿到正文时平台一定先用正文:后端去取论文的 LaTeX 源码并转成可排版的内容,转不出来才只剩 PDF。
| 正文 | ||
|---|---|---|
| 目录 | 右上「目录」浮标:跳转、「上一节 / 下一节」 | 没有目录,只能翻页 |
| 划词操作 | 每段下面「翻译」「AI」「精读」 | 拖选后浮出「翻译 / AI 翻译 / 朗读 / 精读」 |
| 整页译文 | — | 「翻译本页」,进右侧「本页译文」栏 |
| AI 全文理解 | 有 | 没有 |
| 排版设置 | 字体、字号、行高、版心全生效 | 只有页面宽度跟着变 |
几个真实状态,遇到不用怀疑自己:
- 「这篇没有可转换的源码正文」并让你改用 PDF 划词 = 这篇确实没有正文可看
- 加载时写「首次打开可能需要约 15–45 秒(上游限速)」= 平台访问 arXiv 是限流的,排队正常
- 整页报「阅读暂不可用 / 出站限流服务暂时不可用」是出口配额问题,和这篇有没有正文无关,过一会儿再来
- 「没有可展示的节。」= 源码没解析出结构
分节是论文自己定的
章节标题和数量来自论文的 LaTeX 结构,不是平台套的模板,所以你既可能看到规整的几级标题,也可能看到一堆小节。所有节一次渲染在同一条滚动流里,没有折叠展开——「目录」是跳转列表,不是手风琴。章节太多时目录会被截断,并提示「目录已截断,仅显示部分章节。」
排版上保留的东西:公式、表格及题注、图片、脚注([3] 悬停出内容)。公式、脚注、表格不参与划词和翻译,这些能力只给文字段落。参考文献很重,默认不取,页底点「加载参考文献」才拉。
翻译按段给,而且不扣积分
- 正文模式:段落操作条点「翻译」出机器译文,点「AI」出大模型译文,两块分别标「译」和「AI」叠在段落下方;再点一次是「隐藏译文」「隐藏 AI 译文」
- PDF 模式:整页处理,「翻译本页」会显示
n/m进度,译文在右侧栏按段落列出
站内没有「一键翻译全文」,想要通译请去看原文。
这两类译文按原文全局缓存、由平台承担,不扣你的积分,也不记在你的个人 AI 用量上。失败会给「翻译失败」「AI 翻译失败」和一个「重试」。
AI 全文理解:总结与思维导图
只在正文模式有这张卡,按钮是「生成总结」「生成思维导图」;生成过后变成「全文总结」「思维导图」两个标签,各自带「重新生成」。
- 总结内容:中文摘要、English Summary、关键要点、学习收获,外加关键词标签
- 思维导图可切「中 / EN」,支持导出 PNG / SVG / Markdown
- 缓存是论文级共享:任何人生成过,你打开就是现成的,不花你的积分;但点「生成」或「重新生成」都是一次 AI 请求,计入每日 AI 次数——即使命中的是别人留下的缓存
- 生成前要邮箱已验证。常见的三条失败文案:「AI 服务未配置」(平台没接大模型)、「该论文暂无可解析的全文」(没有正文可总结)、「生成失败,请稍后重试」
- 超长正文会被截断,卡片上标「正文较长,生成时已截断部分内容」
划词、生词本、句子精读
点任意词出词典浮层,可直接加入生词本(「已添加到生词本」「已从生词本移除」),你存过的词在正文里带高亮。
「精读」给的是句子级拆解:结构拆解、重点词组、阅读提示,并标明这次是「AI 精读」还是「规则解析」。这是会员能力:走 AI 配额、可能扣积分,不是会员时提示「句子精读需要会员权限」并给「去会员中心」。
两处和文章精读页的差别值得说清楚:这里的精读面板没有「收藏句子」,PDF 拖选工具条也没有「加入生词本」按钮(想存词就点单个词);攒好句请去外刊阅读。
进度只用来回到原位
页面在后台记下你读到哪一节、滚到哪(换节时空闲保存,约 15 秒最多一次),下次打开自动回到上次那一节。这份进度是一张独立的论文级记录:站内既没有 arXiv 的进度条和百分比,也没有「读完」标记,它和小说、文章的进度不是一张表。
建议的读法
- 判断值不值得读:结果页先看摘要,进去直接点「生成总结」,再扫一遍思维导图
- 决定要读:正文模式按目录跳 Method 和 Experiments,术语点词存进生词本
- 卡在某句:正文里点该段「精读」,或 PDF 里拖选后点「精读」