路线图
按预计顺序列出接下来的版本,不承诺日期。每项功能发布后,指南中会补充相应的说明;每个版本的改动见更新日志。
正在开发
AI 预设与内置场景 开发中
提供多个内置 AI 预设:校对(默认)、提示词优化、意图整理、口语聊天、中英互译和要点纪要,可以在首页、标题栏或托盘中切换,也可以自定义预设。内置编程开发、办公写作、即时聊天和专业领域场景,每个场景包含预设、补充要求、专业术语和应用列表。见AI 润色与预设和场景。
2 万条历史记录与统计 开发中
历史记录上限从 500 条提高到 2 万条,首页显示今天、本周、本月和累计的转录字数、修正字数、说话时长和节省的时间。见历史记录。
长录音与电脑声音 开发中
- 单次录音最长 2 小时,时长上限可以在设置中调整。
- 可以录制麦克风、电脑声音,或两者混合。
- 长录音在说话的同时分段识别。
- 结果可以分段交给 AI 预设处理,并导出为 SRT 字幕或文本。
Android 应用 开发中
手机当麦克风和键盘的功能已经完成并通过测试,应用正在准备发布。见手机端。
计划中
- 云端服务的流式识别。目前边说边出字只使用本地的实时识别模型。
- 粘贴前检查获得焦点的输入框能否接受文字。
- 更多本地模型,例如 Whisper,以及在 AMD 和 Intel 显卡上的实测。
- 导出和导入全部数据,以及一键生成诊断信息。
- Windows 安装包的代码签名。
- iOS 应用,与 Android 一样把手机当作麦克风和键盘。尚未开始开发。
刻意不做的功能
- 一直监听,或检测到静音就自动停止。 常开的麦克风可能把周围人的话输入到前台应用中;静音自动停止在嘈杂环境里会截断口述。
- 「边说边输入」时逐句润色。 已经输入的句子无法撤回重写。
- 说话人分离、会议检测和批量转写文件。
- 把浏览器地址、剪贴板或截图作为 AI 润色的上下文。 其中可能包含与这次听写无关的敏感内容。
- 纯浏览器版本。 全局快捷键、向其他应用输入文字和本地模型都需要原生应用。
- 把历史记录、词典、规则或设置同步到手机。 手机只负责麦克风和键盘,识别、纠正和输入都在电脑上完成。
- Windows ARM 和 Linux ARM 的安装包,暂不提供。