使用说明
它是什么
Nutrimatic 是为解谜和构题准备的模式搜索工具。它从已解析语料中统计连续片段, 并按出现频次排序。
中文版本只保留 Unicode 汉字。英文、数字、表情和标点是片段边界;简体和繁体默认 分别保存、精确匹配。
模式语法
查询必须匹配完整候选。中文没有自动插入空格的规则。
| 写法 | 含义 |
|---|---|
春风 | 精确匹配两个汉字 |
. | 任意一个汉字;这是唯一的单字通配符 |
[春秋] | 集合中的一个字;[^春秋] 表示集合外 |
(春|秋)风 | 分组与选择 |
?、*、+ | 零或一次、零或多次、一或多次 |
.{2,4} | 重复 2 至 4 次;也支持 {4}、{4,} |
.*春.*&.{4} | 两边同时匹配同一完整结果:四字且含“春” |
<天地> | 内部各部分可以乱序;多字块可写 <(春风)(秋雨)> |
* 是后缀量词。任意多个汉字写作 .*,任意一个或多个写作 .+。
中文属性
属性都是“匹配一个汉字”的原子,也可以继续使用普通量词。
@p(shan3) | 任一读音为 shan、三声;不写声调表示任意声调 |
@p(*ian3) | 韵尾为 ian、三声;拼音内部只支持安全的 * 通配 |
@b(氵青) | 递归拆分后同时包含“氵”和“青” |
@h(8) | 八画;@h(7-9) 表示七至九画 |
@t(A)@t(A) | 相同 ID 必须匹配同一个字;不同 ID 不保证不同 |
@z(.士林) | 在内置中文词表中补全唯一的 . 槽位 |
拼音会采用多音字的所有可能读音,不按词境消歧。部件与笔画以随程序附带的数据为准。
@z 查询内置词表,不扫描整套正文语料。
为什么有时较慢
搜索按频次优先遍历 Unicode trie。模式开头越明确,通常越快;以 .* 开头、
很长的乱序表达式或大量交集会访问更多节点。达到计算上限时,页面会保留已经找到的结果并标明截断。