先给结论:免费版缺少的关键字段,通常不该靠猜,而应通过“可复现的输入输出对”补回来。也就是说,你不需要拿到付费版字段本身,只需要构造一组能反复验证的短文本,让分词结果、切分边界和词性标注中至少一项形成可核对记录。若工具只展示词表不展示边界,优先补边界证据;若只展示词频不展示上下文,优先补上下文证据。
很多分词工具的免费版会给出分词结果,但隐藏或省略关键字段,例如词性、词频、位置偏移、置信度、自定义词典命中标记。此时会出现一个矛盾:结果肉眼看着合理,但你无法判断它是按通用词典切的,还是按你上传的词表切的;也无法判断某个专名是被识别为一个词,还是被拆成两个词后恰好连在一起。
这个矛盾会直接影响后续动作。假设你准备把分词结果用于搜索召回或文本分类,缺少边界证据时,你只能凭感觉调整词典,调整后也无法确认是词典生效了,还是文本本身变了。下一步就会陷入反复试错。
第一种解释是权限限制:免费版确实计算了这些字段,只是不展示。第二种解释是输出设计限制:该工具在免费层只输出最终词序列,不保留中间标注。两者的区别不在于你能否“看到”,而在于你能否通过其他可观察行为间接验证。
如果是权限限制,通常可以通过替换输入、缩短文本、改变标点或换一种调用方式,观察到输出粒度或排序发生变化。如果是输出设计限制,则无论你怎么换短文本,输出都只呈现同一类信息,缺少的字段不会因为文本变短而出现。
具体动作是:准备三组最小对照文本,每组只改变一个条件,然后分别用免费版处理,并手动记录输出。三组可以这样设计:
记录时不要只抄最终词表,要同时记下输入原文、修改条件、输出顺序和是否有空结果。三次结果中只要有两次能稳定复现同一变化,就可以把该变化当作补充证据。若三次结果完全一致且无法区分条件,则更倾向于是输出设计限制,而不是权限限制。
如果免费版缺少词性字段,优先补“边界证据”。做法是选取包含歧义切分的短句,例如一个专名和一个普通词相邻的字符串,分别测试加词典和不加词典,记录切分位置。边界证据比词性更容易被外部复核,因为它只依赖字符位置。
如果免费版缺少词频或置信度字段,优先补“上下文证据”。做法是保留同一词在不同上下文中的两次输出,观察该词是否始终被切为同一单位。若两次输出不同,说明该词受上下文影响,不能仅凭一次结果下结论。
如果免费版缺少自定义词典命中标记,优先补“替换证据”。做法是先把疑似自定义词替换为同长度的普通词,再替换回来,比较两次输出。若只有疑似自定义词那次保持整体,说明词典可能生效。注意,这个判断仍不是直接读取命中标记,只是间接证据。
假设某免费版只输出空格分隔的词序列,不输出词性,也不输出位置。你怀疑“数据安全”被切成了“数据”和“安全”。你可以构造两个输入:输入A为“数据安全很重要”,输入B为“数据 安全很重要”,其中B在中间加入一个半角空格。若A输出为“数据 安全 很 重要”,B输出为“数据 安全 很 重要”,则无法区分;若A输出为“数据安全 很 重要”,B输出为“数据 安全 很 重要”,则说明空格影响了边界,免费版至少对空白敏感。
这个例子的假设是:工具不改变其他预处理规则,且两次请求之间没有更换词典或模型。若结果不符合假设,下一步应固定输入长度和标点,再重复一次,而不是直接认定词典无效。
如果你已经做了三组对照,仍然只能得到最终词序列,且无法通过替换、增删标点或缩短文本观察到任何差异,那么继续在免费版里补字段的收益很低。此时更合理的动作是:把可复现的输入输出对整理成一份最小记录,标注“缺少的字段”和“已尝试的对照条件”,再决定是否换用其他分词工具或改用人工标注抽样核对。
需要提醒的是,请求量、抓取量或某项统计归零,不能单独证明免费版没有计算该字段。它也可能是缓存、限流、输入格式变化或服务端临时策略导致的。只有当你用同一输入在相近条件下重复得到稳定差异,才适合把差异归因到字段缺失上。具体到某个品牌工具是否提供某字段、免费额度多少、入口在何处,这些信息需要以该工具当前实际页面或文档为准,不能凭通用经验推断。